Самообучающиеся ИИ-агенты завышают собственные оценки: найден способ исправления
Исследователи изучили, как самообучающиеся большие языковые модели (LLM) накапливают опыт без обновления весов. Каждый эпизод сохраняется во внешней памяти, получает оценку и затем извлекается для аналогичных задач. Такой подход формирует неявную политику, где сохранённый балл играет роль прокси-вознаграждения.
В реальных условиях точные метки отсутствуют, поэтому оценку зачастую выставляет сама модель. Это приводит к феномену, названному Эхо-разрывом: ошибочные эпизоды получают завышенные баллы, и агент предпочтительно переиспользует именно те ошибки, в которых он наиболее уверен. Ошибка накапливается через память, а не усредняется.
Авторы формализовали недостающее свойство как предположение независимости ошибок (EIA). Они доказали, что это условие необходимо для исправления инфляции, а не просто желательное качество верификатора. Полезный сигнал должен отслеживать истину и одновременно устранять корреляцию ошибки с памятью.
Инфляция усугубляется не только при ранжировании по сохранённому баллу, но и при обычном поиске по сходству — именно этот режим используется в развёрнутых агентах. Таким образом, проблема носит системный характер.
Для борьбы с ней предложен алгоритм LUCID, работающий без внешних ответов. На тесте BIRD text-to-SQL он повысил точность выполнения до 56,9%, что на 2,9 процентного пункта выше, чем у агента со стилем Memento (54,0%), и на 4,5 пункта выше, чем у агента без памяти с той же архитектурой (52,4%).
Результат демонстрирует, что коррекция памяти без привлечения внешних меток возможна и приносит устойчивый выигрыш. Исследование подчёркивает важность анализа механизмов самооценки при построении автономных ИИ-агентов.







