ИИ-агенты научились эффективнее вызывать инструменты: метод NTEP-R повышает точность анализа изображений
Современные модели зрения и языка, способные отвечать на вопросы по изображениям, часто сталкиваются с задачами, требующими мелких визуальных деталей или внешних знаний. Чтобы восполнить нехватку информации, такие системы получают доступ к инструментам: кадрированию изображения, поиску картинок и текстовому поиску. Однако обучение этих агентов традиционно оценивает только правильность итогового ответа, не заостряя внимание на том, как именно используются инструменты.
Из-за такого подхода модели нередко совершают лишние или неточные вызовы, которые не приносят нужных данных, а иногда даже получив подходящий результат, не извлекают из него информацию, необходимую для решения. Исследователи из группы, работающей над агентными VLM, предложили способ справиться с этим — схему аннотации NTEP.
Эта схема для каждого запроса в явном виде задаёт путь к необходимой информации: какие внешние данные нужны и какие вызовы инструментов к ним приведут. На её основе разработан механизм вознаграждения NTEP-R. В отличие от прежних методов, он оценивает каждый шаг: намерение модели перед вызовом должно соответствовать необходимости в конкретной информации, а вывод, сделанный после получения наблюдения, должен согласовываться с этой целью.
Дополнительно авторы ввели регуляризатор, который препятствует повторным вызовам, направленным на уже выполненную цель. Это сокращает число бессмысленных запросов к инструментам и делает работу модели более целенаправленной.
Эксперименты проводились на семи наборах данных, связанных с вопросами по изображениям. Модель NTEP-8B с восемью миллиардами параметров, обученная по новой методике, показала значительный прирост как в точности поиска информации, так и в эффективности использования трёх инструментов — кадрирования, поиска изображений и текстового поиска.
Результаты подчёркивают важность детального контроля пути сбора информации при обучении агентных моделей. Подход позволяет заставить каждый вызов инструмента работать на достижение конечного решения, что критично для построения надёжных помощников, работающих с визуальными данными. Препринт исследования опубликован на сервере arXiv.



