Новый обзор arXiv: что умеют ИИ-агенты в командной строке и как их оценивать

На arXiv появился обзор, посвящённый ИИ-агентам, которые работают через командную строку. Авторы предлагают называть их терминальными агентами и рассматривать как отдельный класс систем, где основное действие и наблюдение за результатом построены вокруг выполнения команд в терминале.
В статье отмечается, что раньше такие системы описывали разрозненно: в контексте разработки программного обеспечения, использования инструментов или управления компьютером. Новый подход позволяет объединить эти направления и задать общие границы для анализа.
Исследователи выделяют семь измерений компетенций терминального агента. На этой основе они описывают архитектуру, способы приобретения навыков и методы оценки. По их мнению, реальное поведение таких систем формируется совместно моделью, интерфейсом, обвязкой (harness), средой исполнения и окружением.
Важный вывод обзора: исполняемые траектории действий позволяют агенту учиться на последствиях своих действий, проверять результаты и восстанавливаться после сбоев. Однако существующие методы оценки чаще смотрят только на итог, оставляя в стороне качество процесса, восстановление и вопросы управляемости.
Чтобы проверить свои тезисы, авторы провели ограниченные диагностические тесты с фиксированными условиями. Они показали, что разные наборы бенчмарков выявляют разные сигналы о процессах, а сравнение систем в одинаковых условиях демонстрирует зависимость результатов от выбранного бенчмарка и ограничения атрибуции компонентов.
В связи с этим авторы призывают при описании экспериментов явно указывать условия системы и рантайма, а также публиковать воспроизводимые трассы и свидетельства о ходе процессов. Это, по их мнению, обеспечит единую основу для изучения терминальных агентов как в программной инженерии, так и в новых прикладных областях.







