Когда переобучать ML-модели: эксперимент на 3933 запусках показал главный фактор
Группа исследователей представила эмпирическое исследование, посвящённое выбору момента для переобучения моделей машинного обучения в потоковых системах. Работа опубликована в архиве препринтов arXiv и охватывает 3933 экспериментальных запуска.
Авторы исходили из того, что производственные ML-системы со временем деградируют из-за дрейфа концепта — изменения статистических свойств данных. При этом переобучение требует затрат, бюджет ограничен, а новая модель не сразу вступает в работу: пока идёт обучение и развёртывание, система продолжает использовать устаревшую модель.
В эксперименте сравнивались три практические политики обновления: периодическое переобучение, запуск по порогу ошибки и статистическое обнаружение дрейфа с помощью алгоритма ADWIN. В качестве базовой линии использовалась модель без переобучения. Оценка проводилась при различных режимах дрейфа, уровнях бюджета, задержках, на трёх наборах данных и в двух режимах обучения.
Главный результат: наиболее значимым фактором оказалось не то, какая политика переобучения выбрана, а то, обучается ли модель инкрементально. При пошаговом обновлении весов ни одна из политик не дала практически значимого отличия от базовой линии ни в одном из 54 парных сравнений, даже при экстремальной задержке.
Если инкрементального обучения нет, выбор политики начинает сильно влиять: разница в точности после дрейфа достигает 15–55 процентных пунктов. При резком и постепенном дрейфе простое периодическое переобучение значительно превосходит обе реактивные политики. Реактивные подходы сохраняют преимущество только при периодически повторяющемся дрейфе.
Авторы также задокументировали системные сбои реактивных политик и эффект взаимодействия задержки и бюджета: он может незаметно сокращать эффективный бюджет переобучения вдвое. Для воспроизводимости результатов исследователи опубликовали симулятор, конвейеры подготовки данных и артефакты каждого запуска.


