Agentic AI в дата-центрах: исследование Azure выявило архитектурные проблемы

Исследователи представили первую детальную архитектурную характеристику agentic AI — нового класса рабочих нагрузок в дата-центрах. Работа основана на производственном исследовании в Microsoft Azure и контролируемом изучении опенсорсных фреймворков. Авторы построили таксономию agentic-процессов и выявили закономерности потребления ресурсов, которые ставят под сомнение эффективность традиционных однородных серверов.

Ключевой вывод: agentic-выполнение фрагментировано и гетерогенно. Один запрос пользователя превращается в целый workflow из множества LLM-инференсов, вызовов инструментов и оркестрационных решений. При этом операции многократно пересекают границу между CPU и GPU, создавая неравномерную нагрузку на компоненты сервера.

Предложенная таксономия объясняет, как эта фрагментация превращается в спрос на ресурсы. Оркестрация и инструменты выполняются на хосте, поэтому CPU оказывается на критическом пути выполнения. Структура workflow определяет профиль нагрузки во времени: она остается низкой, но с внезапными скачками. Композиция моделей влияет на равномерность использования GPU: разные модели в составе workflow могут загружать GPU неравномерно. Разнообразие задач и инструментов еще больше расширяет этот диапазон.

Эти характеристики вскрывают архитектурные несоответствия традиционных универсальных серверов. Фрагментация выполнения приводит к тому, что мощности CPU и GPU простаивают, несмотря на пиковый спрос. Разные программные роли (оркестрация, инструменты, инференс) требуют различной конфигурации CPU, из-за чего однородное CPU-обеспечение становится неэффективным. Наконец, мультиплексирование множества агентов на общих ядрах ухудшает микроархитектурную локальность, снижая производительность.

Руководствуясь этими выводами, авторы разработали прототип серверной архитектуры под названием Agora для коммерческих серверов. Agora динамически собирает простаивающие CPU-ядра для фоновой работы, одновременно защищая хвостовую задержку агентов от скачков, вызванных вызовами инструментов. Для работы с GPU применяется уплотнение памяти: на каждом GPU размещается больше агентов, а состояние следующего агента предварительно подгружается, чтобы скрыть задержку свопа.

Также Agora объединяет ядра по ролям (оркестрация, инструменты, инференс) и использует планировщик с привязкой к аппаратным ресурсам (affinity-aware scheduling), чтобы восстановить локальность. Механизмы автоматически настраиваются под текущую нагрузку. В результате прототип, по словам авторов, улучшает утилизацию ресурсов и пропускную способность сервера, сохраняя при этом целевую задержку агентских запросов.

Данное исследование — один из первых шагов к пониманию того, как должны выглядеть серверы будущего для эпохи агентного ИИ. Полученные закономерности и предложенный прототип Agora дают конкретные ориентиры для проектирования аппаратного и программного обеспечения дата-центров.