DataPrep-Bench: первый унифицированный бенчмарк для оценки LLM в подготовке данных

На платформе arXiv опубликована статья, представляющая DataPrep-Bench — первый унифицированный бенчмарк для оценки того, насколько хорошо большие языковые модели (LLM) и AI-агенты справляются с подготовкой обучающих данных. До сих пор не существовало единого стандарта, позволяющего измерить весь процесс создания качественных датасетов от начала до конца.

Авторы выделяют две ключевые способности, необходимые для подготовки данных: data construction (преобразование сырых источников в структурированные обучающие примеры) и data quality evaluation (оценка пригодности датасета для последующего обучения). DataPrep-Bench оценивает обе способности в рамках единого протокола, основанного на реальном downstream-обучении, на шести предметных областях и с использованием нескольких базовых моделей.

Для задачи data construction был разработан агент Data-Construction-Skill, который использует навыки для улучшения процесса генерации данных. По данным авторов, этот агент повысил производительность на 20 абсолютных пунктов по сравнению с базовым Dolly-only методом на модели Llama-3.1-8B в финансовой области и показал конкурентоспособные результаты с лучшими существующими подходами в областях, требующих извлечения знаний.

Для оценки качества данных предложена метрика Distributional Alignment Score (DAS), основанная на расстоянии максимального среднего расхождения (MMD) между кандидатным датасетом и прокси-выборкой домена. DAS показала наилучшую кросс-модельную корреляцию в четырёх из шести доменов и стала единственной метрикой, достигшей корреляции выше 0.70 одновременно в математике, науке и медицине, превзойдя существующие методы, основанные на качестве, разнообразии и эвристиках.

Авторы подчёркивают, что DataPrep-Bench предоставляет унифицированную и grounded-на-downstream рамку для измерения прогресса в подготовке данных, рассматривая обе способности как равноправные цели LLM-ориентированной подготовки данных. Это важный шаг в развитии data-centric AI, где качество обучающих данных признаётся критическим фактором успеха моделей.

Работа доступна в открытом доступе на arXiv и уже привлекла внимание сообщества разработчиков и исследователей, работающих над автоматизацией процессов машинного обучения.