Для ИИ-агентов создали бенчмарк с мета-маршрутизацией: точность 100% при затратах ниже на 43%
В новой научной работе на arXiv описан подход к управлению агентными ИИ-системами. Речь о том, как контроллер выбирает последовательность действий: отвечать сразу, разбить запрос, найти данные, запустить код, привлечь специализированного агента или проверить промежуточный результат.
Авторы предлагают исполняемый бенчмарк, где успешность проверяется автоматически после выполнения операций. Он включает 216 обучающих, 72 валидационные, 108 тестовых и 108 задач с изменённой лексикой. Задачи касаются анализа данных, работы с фиксированным корпусом и обработки документов.
Для выбора операций используется мета-маршрутизатор: независимые логистические модели предсказывают вероятности операций на основе текстовых признаков, затем результаты объединяются с учётом ограничений бюджетов по стоимости и числу действий.
Результаты: на тестовом наборе выученная политика показала 100% успеха против 93,5% у статического рабочего процесса, при этом стоимость снизилась на 43%. Одношаговый маршрутизатор достиг только 56,5% успеха.
На более сложном наборе с изменённой лексикой успешность упала до 75,9%, что ниже статического варианта (93,5%), но стоимость осталась на 49% ниже, а отрыв от одношагового маршрутизатора составил 34,3 процентного пункта.
Авторы связывают этот разрыв не с ошибками выполнения, а с ограниченной способностью к лексическому обобщению. Работа представляет собой воспроизводимый тестовый стенд и ограниченное доказательство концепции, а не оценку готовых больших языковых моделей.


