OrthoGrad: ортогональные градиенты снижают переобучение нейросетей на шумных данных
Современные нейросети способны запоминать неверные метки в обучающих данных, что приводит к переобучению. Для борьбы с этим обычно модифицируют архитектуру, функцию потерь или сами данные. Новый подход OrthoGrad предлагает геометрическое вмешательство непосредственно в шаг оптимизации.
Метод заключается в том, чтобы удалять из градиента каждого веса компоненту, параллельную текущему вектору веса. Тем самым обновление направляется только ортогонально, что ограничивает запоминание шумных меток.
Эксперименты проводились на задачах классификации изображений с шумными метками. На MNIST с малым объёмом данных OrthoGrad заметно повысил точность на тестовой выборке для свёрточных сетей, одновременно снижая подгонку под ошибочные метки.
Механизм действия связан с тем, что проекция сильнее всего влияет, когда исходный градиент содержит значительную радиальную компоненту. В режимах с большим объёмом данных градиенты и без того почти ортогональны весам, поэтому эффект слабее.
Дополнительные опыты на CIFAR-10 с архитектурой ResNet-18 показали, что OrthoGrad способен изменить траекторию запоминания, но не предотвращает итоговое переобучение на шумных данных. Метод не является универсальным регуляризатором, его эффективность зависит от режима обучения.
Таким образом, OrthoGrad представляет собой полезный диагностический инструмент для изучения динамики обучения и роли ортогональных ограничений. Результаты подтверждают, что геометрия градиентного обновления может влиять на запоминание шумных меток, хотя и не решает проблему полностью.





