Метод W2SPO ускорил обучение ИИ-рассуждению в 3,5 раза и повысил точность
Исследователи из arXiv представили новый метод обучения языковых моделей с подкреплением — W2SPO (Weak-to-Strong Off-Policy RL). Он решает ключевую проблему: при решении сложных задач, таких как математические рассуждения, генерируемые моделью примеры часто оказываются однотипными и попадают в повторяющиеся ошибочные цепочки, что затрудняет контрастное обучение.
Авторы предлагают использовать вычислительно более лёгкую вспомогательную модель. В процессе обучения в промежуточные траектории основной модели вставляются короткие сегменты — всего 8 токенов, — которые генерирует слабая модель. Далее целевая модель продолжает рассуждение с этого нового состояния. Обучение затрагивает только эти вставленные фрагменты, а итоговая награда вычисляется по успешности решения задачи.
Такой подход позволяет разнообразить траектории и дать модели более контрастные примеры для обучения. Технически метод является off-policy, то есть не требует генерации полных цепочек заново, что экономит вычислительные ресурсы.
В экспериментах на математических бенчмарках с моделями масштаба 4B параметров W2SPO превзошёл стандартные методы пост-тренировки. По сравнению с базой GRPO при одинаковом бюджете сэмплирования Pass@1 улучшился с 62,3% до 64,2% (прирост на 1,9 процентного пункта). При этом скорость обучения выросла в 3,55 раза — то есть модель достигает лучших результатов за существенно меньшее время.
Результаты показывают, что даже слабые вспомогательные ветви могут значительно расширить локальную исследовательскую способность более сильной модели. Это открывает путь к более эффективному обучению рассуждению в больших языковых моделях без необходимости увеличивать число параметров или объём данных.
Полный текст статьи доступен на arXiv по идентификатору 2607.16205.


