Prefix-GRPO: новый метод обучения малых языковых моделей для интерактивных агентов

Малые языковые модели часто рассматриваются как привлекательная основа для интерактивных агентов, однако их прямое обучение на траекториях сильных учителей приводит к неэффективному использованию многошагового поведения. В новом исследовании, опубликованном на arXiv, представлен фреймворк Prefix-GRPO, решающий эту проблему.

Prefix-GRPO — это метод обучения с подкреплением, который разбивает траектории учителя на две части: префиксные запросы, воспроизводимые в среде, и продолжения, выполняемые учеником. После того как префикс воспроизводится в среде для восстановления промежуточного состояния, ученик продолжает взаимодействие онлайн и получает награду за задачу.

В отличие от стандартных методов вроде GRPO, Prefix-GRPO применяет обрезанные обновления политики также к историческим токенам ассистента внутри воспроизведённого префикса. Для оценки старых логарифмических вероятностей используется контрольная точка SFT, полученная дистилляцией политики. Это объединяет обучение префикса и продолжения в единую оптимизацию политики.

Эксперименты проводились на трёх средах: текстовой игре TextCraft, навигационной среде BabyAI и задаче манипуляции ALFWorld. Результаты показали, что Prefix-GRPO улучшает показатели малых моделей по сравнению с методами дистилляции и стандартного обучения с подкреплением.

Дополнительные тесты подтвердили, что простое воспроизведение префиксов без явной оптимизации токенов префикса недостаточно. Таким образом, предложенный подход обеспечивает более полное использование информации из траекторий учителя.

Код и скрипты для воспроизведения экспериментов доступны в открытом репозитории на GitHub. Разработчики отмечают, что Prefix-GRPO может стать важным шагом в создании компактных, но эффективных интерактивных агентов на базе малых языковых моделей.