Метод RHI повышает производительность AI-агентов до 60% при снижении затрат

Разработчики предложили новый подход к обучению AI-агентов — Recursive Harness Self-Improvement (RHI). Этот метод оптимизирует так называемые обвязки (harnesses) — программные компоненты, управляющие взаимодействием модели с внешней средой. В отличие от традиционных подходов, RHI фокусируется на улучшении не только производительности агента, но и качества генерируемых им данных для обучения будущих моделей.

Ключевая идея RHI — итеративное уточнение обвязки на основе парных сравнений её версий. Обвязка представляется в виде текстового описания цикла работы агента, а система сама выбирает лучший вариант по результатам выполнения задач. Это позволяет автоматически улучшать управление контекстом без ручного вмешательства.

Исследователи протестировали RHI на 30 синтетических задачах из областей количественных финансов, робототехники и фармацевтики. Всего за несколько итераций агенты с низким уровнем рассуждений (low-reasoning-effort) достигали результатов, превышающих максимальный порог рассуждений, но при этом затраты на вычисления сократились до 60%.

Авторы отмечают, что прирост производительности обусловлен не удлинением цепочек рассуждений, а более эффективным управлением информационным потоком между частями агента. Таким образом, RHI улучшает контекстное понимание задачи без увеличения сложности модели.

Метод также формализован с точки зрения теории информации: предполагается, что RHI неявно минимизирует информационную энтропию в процессе обучения. Это делает его перспективным инструментом для непрерывного обучения в рамках совместной эволюции модели и обвязки.

Разработка может быть полезна для компаний, стремящихся снизить затраты на развёртывание AI-агентов без потери качества. RHI не требует мощных вычислительных ресурсов и может быть внедрён на этапе эксплуатации модели.