Новый метод CIGPO повышает точность ИИ-агентов при чтении документов на 105%
Исследователи из академического сообщества разработали новый метод обучения ИИ-агентов для многошагового чтения документов — CIGPO (Contextual Information-Gain Policy Optimization). Метод призван решить проблему нестабильности обучения с подкреплением, когда агенты, отвечающие на вопросы на основе нескольких источников, теряют способность следовать формату ответа.
Стандартный подход GRPO (Group Relative Policy Optimization) показал неожиданный сбой: после начального улучшения точности (F1 0.430) модель полностью переходила на вывод, нарушающий заданный формат. Анализ выявил механизм нулевой блокировки преимущества — все сгенерированные траектории получали минимальный штраф, и градиенты обнулялись.
Авторы предложили стратегию инъекции дисперсии: присвоение промежуточным шагам чтения собственных вознаграждений на основе прироста информации (information gain). Для этого используется изменение логарифмической вероятности правильного ответа в замороженной эталонной модели после каждого шага.
В экспериментах на наборе данных HotpotQA с моделью Qwen2.5-3B-Instruct CIGPO достиг показателя F1 0.518, что на 105% выше базового уровня (0.252) и значительно лучше финального GRPO (0.430). Более того, метод сохранял осмысленную вариативность вознаграждения на протяжении всего обучения.
Исследование идентифицирует коллапс дисперсии вознаграждения как конкретный режим отказа для обучения без промежуточных сигналов и демонстрирует, что поканальные IG-вознаграждения могут предотвратить эту проблему в настройке HotpotQA.
Результаты работы могут быть полезны для разработки более надежных агентов на основе больших языковых моделей, способных эффективно извлекать информацию из нескольких документов за несколько шагов.


