Отбор данных для LLM: метод MASS сокращает затраты и сохраняет качество

По мере роста объёмов данных для тонкой настройки языковых моделей отбор качественных подмножеств становится ключевой задачей. Чем меньше данных требуется для обучения, тем ниже затраты и выше эффективность. Однако существующие методы часто измеряют разнообразие прямо в исходном пространстве признаков, где геометрические метрики смешивают семантические направления, мелкие различия в разметке и шум.

Группа исследователей предложила новый подход под названием MASS, который рассматривает выбор данных как иерархическую задачу покрытия — от грубого уровня к более тонкому. На первом этапе метод использует плотный автоэнкодер для обучения низкоразмерных главных координат многообразия, что позволяет группировать данные по смысловым категориям. На втором этапе внутри каждой группы применяется разреженный автоэнкодер TopK для качественного покрытия редких признаков.

Такой двухуровневый механизм позволяет учитывать не только общую структуру данных, но и тонкие различия между образцами, которые важны для дообучения моделей. Авторы отмечают, что подобный подход особенно полезен на этапе пост-обучения, когда отбор данных напрямую влияет на итоговые способности модели.

Эксперименты проводились на наборах данных Vision Flan и LLaVA-CoT — известных бенчмарках для мультимодальных моделей. Результаты показали, что MASS стабильно превосходит сильные базовые методы отбора данных при различных бюджетах выборки. В ряде случаев модель, обученная на небольшом подмножестве, отобранном с помощью MASS, достигала уровня качества обучения на полном наборе данных.

По словам разработчиков, это означает, что значительную часть размеченных данных можно исключать из обучения без потери качества, а в некоторых сценариях — даже улучшать производительность модели. Практическая ценность метода состоит в сокращении вычислительных ресурсов и времени на пост-обучение крупных языковых моделей.

Работа размещена в архиве arXiv и доступна для изучения. Поскольку исследование находится на стадии препринта, выводы требуют дополнительной проверки, однако предварительные результаты выглядят многообещающими для инженеров, занимающихся оптимизацией обучения моделей.