FineServe: реальные нагрузки LLM-сервисов собраны в открытый датасет для оптимизации

Группа исследователей опубликовала в arXiv препринт FineServe — датасета, собранного «в дикой природе» на глобальной коммерческой платформе, предоставляющей доступ к множеству больших языковых моделей (LLM). Работа призвана заполнить пробел в знаниях о реальных нагрузках, с которыми сталкиваются современные онлайн-сервисы на базе LLM.

Эффективное обслуживание LLM требует детального понимания динамики запросов: низкая задержка и высокая пропускная способность необходимы при волатильном спросе. Однако существующие исследования часто используют синтетические трейсы или слишком обобщённые характеристики, не учитывающие разнообразие моделей и задач на реальных платформах.

FineServe включает данные о времени поступления запросов, количестве генерируемых токенов и других параметрах для множества моделей разных архитектур и размеров. Анализ выявил принципиально различные режимы флуктуаций трафика в зависимости от модели и задачи: например, небольшие модели могут испытывать резкие пики, а крупные — более равномерную нагрузку.

На основе полученных закономерностей авторы разработали генератор рабочих нагрузок FineServe. Он позволяет компоновать тонкие, зависящие от модели нагрузки в настраиваемые смеси, пригодные для бенчмаркинга платформ, обслуживающих сразу несколько LLM.

По заявлению исследователей, FineServe обеспечивает более реалистичную основу для оценки стратегий маршрутизации запросов, планирования и управления ёмкостью в системах обслуживания LLM. Датасет и инструменты доступны на GitHub по ссылке, приведённой в статье.