Новый оркестратор ускоряет передачу данных при распределённом инференсе LLM до 18 раз
Раздельный инференс больших языковых моделей, когда предварительное заполнение (prefill) и генерация (decode) выполняются на разных GPU-пулах, порождает серьёзную сетевую проблему: между этими пулами необходимо передавать KV-кэш. Для модели с 70 миллиардами параметров это 2,6 гигабайта на каждый запрос, что при производственных нагрузках превышает 100 гигабайт в секунду агрегированного трафика.
Существующие системы, такие как DistServe, Splitwise и Mooncake, используют единообразный RDMA-транспорт, игнорируя физическое расположение GPU. Между тем пропускная способность в зависимости от взаимного положения чипов различается в 72 раза: 900 ГБ/с через NVLink внутри домена, 50 ГБ/с через InfiniBand между узлами и всего 12,5 ГБ/с по TCP между дата-центрами.
Авторы работы, опубликованной на arXiv, предлагают оркестратор, который при запуске обнаруживает иерархию межсоединений и для каждой передачи выбирает оптимальный транспорт. В основе решения — три механизма, работающих совместно.
Первый — конвейерная передача слой за слоем: она перекрывает пересылку с продолжающимся prefill, скрывая от 60 до 85 процентов задержки за вычислениями. Второй — размещение экспертов для моделей типа Mixture-of-Experts с учётом NVLink-доменов, что позволяет совместно оптимизировать диспетчеризацию экспертов и локальность KV-кэша.
Третий механизм использует расширители памяти CXL 3.0 как общий буферный ярус. Они обеспечивают шестикратное увеличение ёмкости и в 86 раз меньшую задержку по сравнению с NVMe. Однако полная оценка требует кластеров с гетерогенными межсоединениями и оборудованием CXL 3.0, которое пока недоступно в академических ресурсах и GPU-облаках.
Авторы представили аналитические модели пропускной способности, реализации компонентов и расчётные оценки на трёх архитектурах. По их данным, новый подход сокращает задержку передачи данных в 3–18 раз по сравнению с единообразным RDMA. Это может стать важным шагом к более эффективному использованию распределённых GPU-систем для инференса больших языковых моделей.




