PPO-HSC: новый фреймворк для fine-tuning LLM повышает разнообразие решений без потери точности

Исследователи из международной группы представили новый фреймворк для тонкой настройки больших языковых моделей (LLM) — PPO-HSC (Proximal Policy Optimization with High-order Sampling Coverage). Как указано в препринте на arXiv, метод решает проблему так называемых «невидимых оков», когда модель переоптимизируется на известные высоконаградные траектории и теряет способность к исследованию.

Стандартный подход Reinforcement Learning from Verifiable Rewards (RLVR) эффективно усиливает правильные цепочки рассуждений, но часто приводит к коллапсу мод: модель начинает повторять однотипные решения, жертвуя любопытством. PPO-HSC вводит дополнительный сигнал поощрения — High-order Sampling Coverage (HSC), который стимулирует поиск паттернов с низкой семантической похожестью, но сохраняющих высокую валидность.

Для этого фреймворк поддерживает динамическую библиотеку проверенных уникальных решений. Дифференцируемый сигнал вознаграждает семантическую новизну, а встроенное ограничение правдоподобия гарантирует структурную рациональность. Таким образом, модель получает стимул выходить за рамки привычных шаблонов, не теряя качества ответов.

Эмпирические испытания проводились на задачах математического рассуждения (датасеты GSM8K и SVAMP) и генерации кода. Результаты показали, что PPO-HSC значительно увеличивает разнообразие решений и покрытие пространства состояний, при этом точность и синтаксическая целостность сохраняются на уровне или превосходят современные бейзлайны RL.

По мнению авторов, предложенный подход может стать важным шагом к созданию более гибких и исследовательских LLM, способных находить неочевидные, но верные пути решения. Дальнейшие работы могут быть направлены на масштабирование метода и его адаптацию для более сложных мультимодальных сценариев.