Мультимодальный агент Tinycloud: полная загрузка навыков в промпт улучшает выбор инструментов

Мультимодальный агент Tinycloud: полная загрузка навыков в промпт улучшает выбор инструментов

На arXiv опубликован case study, посвящённый системе Tinycloud — продакшен-харнесу для мультимодального видеоагента. Авторы разобрали, как выбор представления навыков влияет на способность LLM-планировщика найти нужное действие.

В продакшен-харнесе агент должен обнаруживать и ранжировать навыки из растущей библиотеки. На малом масштабе выбор происходит в контексте: планировщик видит описания навыков в системном промпте и не использует отдельный этап эмбеддинг-поиска. Такой подход авторы называют небольшим аналогом массового поиска навыков.

Tinycloud использует два типа представлений: инструментальные навыки, которые оборачивают один внешний API или системный инструмент, и рабочие процессы, которые объединяют вызовы инструментов и шаблон для создания итогового результата. В системном промпте навыки выводились двумя способами: полные инструкции и скрипты для автозагруженных навыков, либо однострочное перечисление для остальных.

В эксперименте на шести задачах сравнили три режима: полную автозагрузку, производственный режим по умолчанию и полное отключение. Полная автозагрузка выбирала нужный навык во всех шести случаях. При отключении всех навыков выполнение замедлялось, а часть задач не удавалось решить из-за невозможности обнаружить нужный инструмент.

Производственный режим по умолчанию ошибся в одной задаче: лексический сигнал названия конфликтовал с автозагруженным инструментальным навыком, и планировщик упустил подходящий навык из однострочного списка. Авторы делают вывод, что встраивание навыков в промпт не всегда монотонно полезно — частичная выдача может создавать конкуренцию и подавлять верный выбор.

Это наблюдение связано с недавними работами по маршрутизации навыков на основе эмбеддингов в крупных системах. Авторы подчёркивают, что представленный материал стоит рассматривать как практический пример, а не как эталонный бенчмарк. Результаты говорят о том, что при проектировании системных промптов нужно учитывать не только содержимое описаний, но и их взаимное влияние.