SDO: новый метод ускоряет пост-обучение больших языковых моделей
Пост-обучение больших языковых моделей требует значительных вычислительных затрат. Существующие методы повышения эффективности обычно концентрируются на отборе информативных примеров или планировании расписания обучения. Однако сама организация данных, как правило, остается статическим этапом: группы, построенные на основе эмбеддингов, формируются до начала обучения и не адаптируются к тому, как модель реально взаимодействует с примерами.
Из-за этого все образцы получают примерно одинаковое внимание, хотя их потребности в оптимизации различаются. Некоторые примеры обновляются избыточно, другие остаются недообученными. Исследователи предлагают новый подход — SDO (Structure-Aware Data Organization), который решает эту проблему за счет механизма обратной связи по экспонированию примеров.
SDO работает эпоха за эпохой на замороженных внешних эмбеддингах, не требуя разогрева модели. Внутри каждой эпохи применяется локально-осознанная сборка батчей: через обход окрестностей KNN формируются связные мини-батчи. Между эпохами работает балансировка экспозиции: система запоминает, насколько часто каждый пример участвовал в обучении, и снижает вероятность выборки для переэкспонированных образцов, сохраняя долгосрочное покрытие.
Метод был протестирован на этапах SFT, DPO и GRPO. Результаты показывают ускорение сходимости, причем наибольший эффект достигается в ранней и средней фазе обучения. Получены более когерентные градиенты и более сбалансированная точность по типам вопросов. При этом ни один тренировочный пример не исключается из выборки безвозвратно.
Ключевое преимущество SDO — универсальность и простота интеграции. Фреймворк подключается как plug-and-play, не требуя изменений в архитектуре модели. Это делает подход перспективным для компаний и исследовательских групп, стремящихся сократить расходы на пост-обучение без потери качества.
Разработка представлена в виде научной статьи на arXiv. Подход особенно актуален в условиях роста стоимости вычислительных ресурсов и необходимости эффективного использования существующих данных. Дальнейшие исследования могут быть направлены на адаптацию метода к другим видам обучения и более сложным стратегиям балансировки экспозиции.







