Новый бенчмарк UserToolBench проверит, насколько ИИ-агенты понимают скрытые предпочтения пользователей

Языковые модели, умеющие работать с инструментами, всё чаще выполняют действия от имени пользователей — от бронирования до заказа услуг. При этом существующие бенчмарки в основном оценивают запоминание профиля, стиль ответа или отдельные вызовы инструментов. Новая работа на arXiv представляет UserToolBench — бенчмарк для проверки персонализированного принятия решений в таких системах.
Авторы поставили задачу выяснить, может ли модель по истории взаимодействий вывести скрытые предпочтения человека, понять, когда нужны уточняющие вопросы, и построить цепочку вызовов инструментов, соответствующую интересам пользователя даже при неполной информации.
В основе бенчмарка — обезличенные реальные сценарии взаимодействия, дополненные структурированными профилями, типовым набором API-инструментов и длинными многоходовыми диалогами. Всего в наборе 10 пользовательских профилей, 36 наборов инструментов, 1065 реплик и 170 уникальных инструментов. Задания разбиты на категории: нехватка информации, работа с одним инструментом и с несколькими.
Эксперименты с несколькими сильными моделями показали, что даже продвинутые системы испытывают серьёзные трудности с делегированием задач. Основными проблемными зонами оказались координация нескольких инструментов, восстановление недостающих ограничений и поддержание поведенческой согласованности на длинных горизонтах.
По мнению исследователей, это означает, что оценка персонализации должна сместиться от формальной имитации манеры общения к проверке того, действительно ли модель принимает правильные решения за пользователя. Такой подход, вероятно, приведёт к пересмотру критериев качества для ИИ-агентов, работающих с внешними сервисами.
Разработчики отмечают, что UserToolBench может стать ориентиром для будущих исследований в области персональных ИИ-ассистентов, где ключевой становится не только точность вызовов, но и соответствие действий невысказанным ожиданиям пользователя. Пока же результаты подтверждают: до надёжного автономного представительства человека в цифровой среде ещё далеко.





