Nexus: метод ускоряет агентные LLM в 1.7 раза при работе с 250 инструментами

Агентные большие языковые модели, работающие через Model Context Protocol, вынуждены перекодировать подробные схемы инструментов на каждом шаге. Из-за квадратичной зависимости prefill от длины последовательности время до первого токена растет с расширением реестра инструментов. Новая работа на arXiv предлагает обходной путь под названием Nexus.
Основная идея Nexus — отделить маршрутизацию инструментов от стоимости prefill схем. Вместо полного перекодирования всех схем используется INT8-буфер семантического поиска с откалиброванным кросс-энкодером. Модель выбирает инструменты по сжатым сигнатурам, которые в среднем занимают 19 токенов, а не по полным KV-кэшам.
По данным авторов, точность маршрутизации сохраняется около 89% при масштабировании реестра до 250 инструментов. Для сравнения, базовый подход с объединением всех схем полностью переполняет контекстное окно. При этом первый аргумент генерируется в 1.66 раза быстрее, а экономия основного контекста достигает примерно 80%.
Второй механизм Nexus — пересадка скомпилированного KV-блока схемы в живой контекст. Этот метод ограничен дрейфом фаз в позиционном кодировании RoPE. Если вставка выполнена не в опорной позиции, внимание нарушается, поэтому после порога P=256 система переключается на суффиксный редеход с повышением глубины вплоть до полного prefill.
Авторы подчеркивают свойство never-regress: гарантируется верность выходных данных (совпадение top-1, KL-дивергенция около нуля), но не задержка. В умеренных глубинах ускорение TTFT составляет 1.1–1.7 раза, а при глубоком контексте сходится к паритету.
В работе также зафиксированы два негативных результата. Во-первых, существует граница точности RoPE при off-anchor вставке. Во-вторых, референсно-свободный дрейфовый гейт не смог предсказать дрейф: коэффициент корреляции Спирмена составил лишь 0.193.
Все измерения выполнены на связке Qwen2.5-14B-Instruct Q4_K_M в унифицированной памяти Apple Silicon. Как отмечают исследователи, качественные границы метода обобщаются, а количественные показатели специфичны для данной модели и конфигурации.







