Data-DPO: новый метод отбора данных для дообучения LLM превзошёл обучение на полном датасете

На arXiv опубликован препринт, авторы которого предлагают Data-DPO — новый подход к отбору данных для этапа supervised fine-tuning (SFT) больших языковых моделей. Метод ориентирован на целевую модель и учитывает её текущий уровень способностей, а не рассматривает ценность данных как статическую характеристику.

Существующие подходы к выбору данных обычно оценивают сэмплы независимо от модели. Авторы утверждают, что совместимость данных с распределением способностей конкретной модели играет ключевую роль. Data-DPO решает эту задачу через наблюдение за локальным обучающим сигналом на разных сэмплах.

На первом этапе Data-DPO выполняет одношаговое зондирование: анализируется, как изменяются активации целевой модели при обучении на различных примерах. Разница в активациях преобразуется в попарные предпочтения, на основе которых обучается лёгкая reward-модель. Она усваивает, какие данные более полезны именно для этой модели.

При финальном отборе Data-DPO комбинирует три сигнала: предпочтения целевой модели, внешние оценки качества данных и маргинальное разнообразие. Такое сочетание позволяет собрать стабильное и эффективное тренировочное подмножество.

В экспериментах на наборах Vision-Flan и LLaVA-CoT Data-DPO стабильно превосходит существующие бейзлайны при различных бюджетах данных. Более того, метод показывает результаты выше, чем обучение на полном датасете, что позволяет сокращать вычислительные затраты без потери качества.

Работа опубликована на arXiv под идентификатором 2608.16926. Детали реализации и сравнительные таблицы доступны в препринте.