Новый метод CompPO повышает точность RL-обучения больших языковых моделей

Группа исследователей опубликовала на arXiv препринт, посвящённый улучшению credit assignment — механизму распределения вознаграждения между токенами — в обучении больших языковых моделей с подкреплением (LLM RL). Авторы предлагают общий фреймворк computation-conditioned credit transport (CCT) и конкретный алгоритм CompPO, который учитывает внутреннюю траекторию вычислений самой модели.
Существующие подходы, такие как GAE с фиксированным дисконтом или групповые методы вроде GRPO, используют архитектурно-независимые операторы переноса. Они либо применяют стационарное геометрическое ядро вдоль времени токена, либо распространяют статистику результата на весь ответ. При этом они не отражают конкретные вычисления, которые выполняет Transformer при генерации.
CompPO решает эту проблему, используя детектированную статистику внутренних вычислений поведенческой политики для параметризации каузального ядра — так называемых retention gate. Этот gate участвует в одношаговой загрузке и в траекторно-зависимом обобщённом преимуществе (Comp-GAE). Дополнительно предложен критик TAC, который переиспользует скрытые состояния и информацию о маршрутизации актора без создания второй модели того же масштаба.
Эксперименты проводились на моделях Qwen3-4B и Llama-3.1-8B-Instruct. CompPO достиг финальной точности 61,4% на удержанном наборе данных (95% ДИ: 60,8–62,0), тогда как настроенный GRPO показал 53,8% (95% ДИ: 52,9–54,7). При этом замена части компонентов снижала результат: Comp-GAE со стандартным критиком дал 55,2%, а TAC с фиксированным gate — 56,4%, что подтверждает важность совместного использования.
Анализ с перемешиванием токенов и позиционными контролями показал, что траекторно-специфичное выравнивание действительно влияет на результат. CompPO оказался стабилен в 10 из 12 запусков сетки PPO, тогда как GRPO — только в 3 из 12. На замороженной оценке улучшение по сравнению с GRPO составило 4,3 пункта для Qwen3-4B и 3,9 пункта для Llama-3.1-8B (метрика greedy pass@1 macro).
Авторы отмечают, что их метод не меняет task reward и функцию потерь PPO, а фиксированный gate является частным случаем Comp-GAE, что упрощает внедрение в существующие пайплайны. Работа представлена как препринт и ещё не прошла полное рецензирование, однако она указывает на перспективное направление: связывание credit transport с внутренней архитектурой модели может стать важным шагом для более эффективного RL-обучения LLM.







