Метод GLOBE повышает точность обучения нейросетей на устройствах при сжатых данных
Обучение глубоких нейросетей непосредственно на смартфонах и других устройствах ограничено вычислительными мощностями и памятью. Одним из способов решения проблемы служит отбор компактного подмножества обучающих данных — coreset selection. Однако существующие градиентные методы часто используют информацию только с одного снимка модели и не учитывают связанные между собой примеры.
В новой работе на arXiv представлен алгоритм GLOBE (Gradient Local-Balanced Extraction). Он формирует задачу отбора как глобальную оптимизацию разреженных весов. Каждый образец описывается градиентной траекторией, построенной по нескольким контрольным точкам обучения, что позволяет учесть его влияние на разных этапах оптимизации.
Авторы предложили многоуровневую целевую функцию, которая одновременно согласует первые моменты и проекции ненормированных вторых моментов градиентных траекторий. Это помогает сохранить поведение полного набора данных при обучении на отобранном подмножестве.
Для разреживания весов GLOBE объединяет групповой LASSO, регуляризацию Elastic Net и ограничение неотрицательности бюджета. Такой подход подавляет сильно коррелированные траектории и обеспечивает разреженность как на уровне групп, так и на уровне отдельных примеров. Финальный этап — класс-сбалансированная Top-K выборка, сохраняющая достаточное покрытие категорий при ограниченном бюджете.
Эксперименты проводились на шести бенчмарках с пятью архитектурами. Согласно результатам, GLOBE стабильно превосходит существующие методы отбора подмножеств по точности на тестовых выборках, особенно при низких коэффициентах удержания данных.
Авторы подчёркивают, что сочетание динамической градиентной информации, согласования распределений нескольких порядков и структурной разреженности открывает новые возможности для энергоэффективного обучения моделей на периферийных устройствах.





