Мультиагентный фреймворк KernelArc ускорил GPU-ядра и возглавил бенчмарк SOL-ExecBench

В новой научной работе, опубликованной на arXiv, представлен фреймворк KernelArc, предназначенный для автоматической оптимизации GPU-ядер. Разработка использует мультиагентный подход: несколько специализированных агентов работают параллельно, обмениваясь только выводами через общую память. Это позволяет ускорить поиск оптимальных конфигураций для широкого круга вычислительных задач.

Авторы протестировали KernelArc на графических процессорах NVIDIA H100 и B200, используя набор эталонных задач SOL-ExecBench. Результаты оказались впечатляющими: на публичном снимке лидерборда, датированном 30 июля 2026 года, решения, построенные с помощью фреймворка, заняли первые места в категориях L1, L2, Quantization и FlashInfer. Это говорит о том, что мультиагентный поиск способен находить более сильные реализации, чем традиционные методы.

Среди сгенерированных KernelArc реализаций — собственные варианты BF16 GEMM, статические таблицы конфигураций cuBLASLt Expert-API, гибридный обратный проход для смеси экспертов, сегментированное объединение декодеров, нативное групповое внимание NVFP4 и paged prefill attention. Таким образом, фреймворк охватывает широкий спектр алгоритмов, критичных для современных LLM и высокопроизводительных вычислений.

Ключевая особенность KernelArc — координация через общую память только выводов, а не всех промежуточных состояний. Это позволяет агентам избегать дублирования работы и сосредоточиться на перспективных направлениях. Дополнительно используется детерминированный контроль бенчмарков и защита от записи в общие данные, что повышает стабильность и воспроизводимость результатов.

По мнению исследователей, ценность отдельных механизмов координации зависит от типа ядра и стадии оптимизации, но в целом мультиагентный подход расширяет пространство поиска и позволяет достигать более сильных результатов при ограниченном бюджете на генерацию кандидатов. Это открывает путь к дальнейшей автоматизации низкоуровневой оптимизации для разных аппаратных платформ.