Представлен Belief-Calibrated Optimization: метод с мировой моделью улучшает ИИ-агентов
На arXiv опубликовано исследование, посвящённое новому методу Belief-Calibrated Optimization (BCO). Авторы предлагают способ повысить эффективность ИИ-агентов, которые используют замороженную модель и внешний программный каркас. Как сообщается в аннотации, BCO записывает предположения агента о поведении среды и превращает их в постоянно обновляемый документ.
Проблема многих современных подходов в том, что агент-оптимизатор, читая текущие оценки и трассы, выбирает следующее изменение исходного кода на основе неявного представления о том, что пошло не так и какое изменение поможет. Это представление обычно остаётся внутри логики модели или в её параметрах и не используется в следующих вызовах. BCO решает эту проблему, делая такое знание явным и доступным для последующих итераций.
Созданный документ авторы называют мировой моделью — актуальным описанием того, как среда реагирует на правки. Эта модель добавляется к стандартному циклу оптимизации, и, по данным исследователей, метод показывает более высокую точность на обучающей выборке, чем контрольный вариант без мировой модели. Тесты охватывают пять бенчмарков: память в QA-задачах, использование инструментов в QA, приложения с кодом-действием и терминальные агенты.
Разрыв в точности сохраняется на каждом отложенном наборе данных, который не использовался для выбора кандидата. Это говорит о том, что улучшение не является переобучением под конкретный тест. Для дополнительной проверки исследователи заменили целевую модель: замороженная модель была заменена, а каркас остался прежним. Выбранный каркас с BCO показал лучшие результаты на проверяемых задачах, за исключением случаев, когда превышение длины контекстного окна не позволяло завершить работу.
Отдельный абляционный эксперимент показал, что улучшение связано именно с содержанием документа. Свежий предсказатель, которому давали накопленный документ, прогнозировал реакции среды точнее, чем предсказатель без документа или с документом, содержание которого было искажено. Авторы делают вывод, что документ несёт переиспользуемую информацию, а не только формально структурированную запись.
Таким образом, BCO предлагает простой и эффективный способ улучшить программы-агенты, сохраняя информацию о поведении среды в явном виде. Исследование может повлиять на разработку агентных систем, где важна итеративная настройка поведения без переобучения базовой модели.



