Новый метод PlanPO повышает эффективность ИИ-агентов на 27% в многошаговых задачах

Группа исследователей опубликовала на arXiv preprint описание нового метода обучения агентных языковых моделей — PlanPO (Group Planning-Aware Policy Optimization). Разработка направлена на решение проблемы, связанной с обучением LLM в многошаговых интерактивных задачах, где агент должен принимать последовательность решений.
Существующие подходы, основанные на групповой оптимизации политики, часто присваивают одинаковую награду всем успешным траекториям, даже если одна из них была значительно эффективнее другой по числу шагов или объёму текста. Это приводит к так называемому коллапсу преимуществ и ограничивает производительность модели.
PlanPO решает эту проблему через введение coarse-to-fine сигналов преимущества. Метод учитывает относительную разницу в длине траекторий и длине ответов на каждом шаге, но только среди успешных примеров одной задачи. Такой подход позволяет агенту обучаться обобщаемым навыкам планирования и генерации текста, не вырождаясь в простое сокращение длины.
В экспериментах авторы сравнили PlanPO с базовым методом GRPO на трёх популярных бенчмарках: ALFWorld, WebShop и SciWorld. Среднее улучшение составило 27,2% по сравнению с GRPO. При этом новый метод превзошёл и ряд других мощных базовых линий, а дополнительные вычислительные затраты на обучение оказались незначительными.
Отмечается, что PlanPO особенно полезен для задач, где важна не только правильность, но и эффективность действий агента, например, в веб-навигации, виртуальных средах или научных симуляциях. По словам авторов, модель учится не просто копировать высококачественные паттерны поведения, а вырабатывает собственное планирование, которое переносится на новые ситуации.
Исследование продолжает линию развития методов оптимизации политик для агентных LLM и открывает возможности для создания более автономных и экономичных ИИ-систем, способных решать сложные многоэтапные задачи с минимальным вмешательством человека.
Ознакомиться с полным текстом работы можно по ссылке arXiv:2608.17289.







