NOMADD: новый метод борьбы с дрейфом данных без переобучения моделей

Научная группа опубликовала на arXiv препринт, посвящённый новой пост-обработке моделей машинного обучения для борьбы с дрейфом данных. Разработка получила название NOMADD (Numerical Optimization of Models Adapting to Data Drift).

В реальных системах распределение признаков или связь между признаками и целевой переменной со временем меняются. Это явление известно как дрейф данных. Классические модели, обученные на исторических данных, начинают ошибаться. Оперативно переобучить модель не всегда возможно: свежих размеченных данных может не быть, а вычислительные ресурсы ограничены.

Существующие инструменты снижения дрейфа обычно встроены в процесс обучения и привязаны к конкретным архитектурам нейросетей. NOMADD предлагает иной подход: корректировка модели уже после её обучения. Такой метод применим к широкому кругу моделей — от градиентных бустингов до нейросетей и табличных foundation-моделей.

Алгоритм обучает базовую модель отдельно на каждом размеченном временном периоде, а затем сравнивает изменение её параметров с единой «якорной» моделью, построенной на всех данных. Эти изменения сжимаются с помощью низкоранговой факторизации, после чего каждый латентный фактор экстраполируется в будущее с помощью демпфированного регуляризованного прогноза. Такой подход позволяет предсказывать, как должна эволюционировать модель, без необходимости немедленного переобучения на новых данных.

Авторы проверили метод на 18-даттасетном бенчмарке Drift-Resilient TabPFN, используя его собственную методику оценки. Экстраполяция улучшила качество всех базовых семейств моделей, к которым применялась, и достигла результатов, сопоставимых со state-of-the-art решением Drift-Resilient TabPFN. При этом обучение NOMADD занимает секунды, тогда как Drift-Resilient TabPFN требует предварительного обучения на миллионах синтетических наборов данных и около 1300 GPU-часов, а инференс у него на порядки медленнее.

В обсуждении авторы отмечают перспективы расширения метода на другие модальности данных, но указывают и на сложности, которые предстоит решить. Работа опубликована в открытом доступе, что позволяет другим исследователям воспроизвести результаты и адаптировать подход под свои задачи.