Новый алгоритм маршрутизации запросов к LLM сокращает задержки и повышает точность

Команда исследователей представила в репозитории arXiv новый подход к маршрутизации запросов к большим языковым моделям (LLM), который позволяет одновременно оптимизировать задержку, точность и стоимость выполнения.

Существующие системы маршрутизации обычно выбирают модель, балансируя качество ответа и денежные затраты, но не учитывают время генерации, которое зависит от длины промпта, текущей загрузки сервера и политики пакетной обработки. На практике для контроля задержек часто используются простые методы балансировки нагрузки, такие как round-robin или выбор очереди с наименьшим числом задач, которые игнорируют точность и стоимость.

Разработчики создали лёгкий оценщик задержки, который моделирует процесс авторегрессивной пакетной обработки токенов и предсказывает время до первого токена (TTFT). Этот оценщик интегрирован в новый маршрутизатор, который при назначении запроса модели учитывает три фактора: задержку, точность и стоимость.

Эксперименты показали, что совместная оптимизация позволяет улучшить показатель полезности точность-стоимость на 40% по сравнению с обычными методами балансировки, при этом время ответа остаётся на том же уровне. Исследователи подчёркивают, что их подход особенно актуален для динамических рабочих нагрузок, где нагрузка на серверы постоянно меняется.

Работа опубликована на arXiv с идентификатором 2607.18253. Разработчики планируют дальнейшие исследования для адаптации метода к различным сценариям развёртывания LLM.