Woodpecker Distillation: слабые модели ИИ научились исправлять ошибки сильных
Большие языковые модели часто спотыкаются на задачах, требующих многошаговых рассуждений, даже если в принципе способны их решить. Авторы нового исследования на arXiv предположили, что причина не в общей некомпетентности, а в локальных сбоях на отдельных шагах логической цепочки.
Такие сбои, по мнению учёных, часто можно исправить с помощью короткой вставки — патча, сгенерированного слабой моделью. Если подставить этот патч в то место, где сильная модель ошиблась, она с высокой вероятностью вернётся на верный путь и дорешает задачу правильно.
Однако при прямой дообучении на таких патчах или на исправленных траекториях положительный эффект не закрепляется. Полезный сигнал, как выяснилось, заключается не в самом тексте вмешательства, а в том, как он меняет распределение будущих рассуждений модели.
Для решения этой проблемы авторы разработали метод Woodpecker Distillation. Это подход к обучению, в котором сильная модель учится на контрастных локальных вмешательствах: сравниваются успешные и неудачные патчи слабой модели на одном и том же участке рассуждений, строится корректирующее распределение, которое затем переносится в сильную модель через дистилляцию.
В экспериментах на математических бенчмарках Woodpecker Distillation устойчиво улучшал результаты сильных моделей. Метод также обошёл прямое имитационное обучение, при котором модель просто повторяет действия слабой модели.
Работа предлагает новый взгляд на повышение надёжности ИИ: вместо того чтобы наращивать размер модели или данных, можно точечно исправлять ошибки рассуждений, используя слабые модели как диагностический инструмент. Это может быть полезно для систем, где важна объяснимость и точность промежуточных шагов.


