InferenceBench: ИИ-агенты ускоряют LLM-инференс до 8 раз, но проигрывают простому поиску

Группа исследователей разработала новый бенчмарк InferenceBench, предназначенный для оценки способности ИИ-агентов самостоятельно оптимизировать скорость инференса больших языковых моделей (LLM). В отличие от существующих тестов, которые часто проверяют агентов на узких задачах или готовых рецептах, InferenceBench моделирует открытую инженерную среду.
В рамках бенчмарка агент получает целевую LLM, один GPU H100, сценарий оптимизации и два часа реального времени. За это время он должен развернуть OpenAI-совместимый сервер и максимизировать пропускную способность или минимизировать задержки. Всего предусмотрено четыре сценария: упор на prefill-латентность, decode-латентность, пропускную способность при параллельных запросах и сбалансированный режим.
В экспериментах 15 конфигураций ведущих ИИ-агентов стабильно улучшали наивный базовый PyTorch — вплоть до 8,08-кратного ускорения. Они также часто достигали или превосходили производительность стандартных серверных движков, таких как vLLM (4,05x). Однако при одинаковом временном бюджете простой автоматический перебор гиперпараметров давал ускорение до 11,53x — то есть агенты систематически ему уступали.
Качественный анализ траекторий агентов показал, что они перечисляют множество релевантных техник оптимизации, но в итоге сходятся на одном фреймворке для инференса. Агенты тестируют лишь несколько различных конфигураций, а оставшееся время тратят на перезамеры, исправление ошибок и подстройку гиперпараметров, вместо того чтобы исследовать принципиально иные стратегии.
Авторы делают вывод, что узким местом является не знание методов ускорения (агенты в курсе техник), а способность генерировать разнообразные конфигурации, систематически их оценивать и выбирать наилучшую. Это отражает реальные сложности автономной инженерной работы в открытой среде, где заученные решения дают лишь ограниченный выигрыш.
InferenceBench доступен на arXiv (2607.20468) и может стать новым стандартом для оценки ИИ-агентов в задачах оптимизации производительности. Ожидается, что бенчмарк поможет выявить слабые места современных агентов и стимулировать разработку более эффективных алгоритмов исследования пространства решений.







