Масштабное исследование GitHub Copilot раскрыло особенности ИИ-агентов в кодинге

Исследователи представили в arXiv первый масштабный анализ работы ИИ-агентов для написания кода. В основе работы — обезличенные данные GitHub Copilot за июнь 2026 года, охватившие 3,2 миллиона пользователей, 13 миллионов сессий, 761 миллион вызовов языковых моделей и 95 триллионов токенов.

Агентный кодинг — это новый класс рабочих нагрузок, где модель выполняет несколько шагов рассуждений, чередуя их с вызовами инструментов. По мнению авторов, такая структура кардинально отличается от привычных чат-диалогов и требует пересмотра того, как устроены серверы для LLM.

Ключевая особенность — сессии с разреженными действиями пользователя. Каждое такое действие запускает автономный цикл агента, где почти каждый вызов модели сопровождается выполнением инструмента. Это приводит к высокому проценту попаданий в кэш ключей-значений: в среднем 90% внутри одного витка, но при переходе между витками показатель падает до 55%.

Особенно резкое обесценивание кэша происходит при переключении моделей или сжатии контекста. Такие события происходят в реальных сессиях достаточно часто, что делает текущие механизмы кэширования малоэффективными для агентного сценария.

Исследование также выявило значительное разнообразие рабочих процессов: потребление токенов, длительность сессий и число вызовов инструментов сильно варьируются и имеют длиннохвостое распределение. Это создаёт дополнительные сложности для планирования ресурсов.

Одна из важных практических находок — разница между быстрым внутренним циклом агента и длительными паузами пользователя на границах витков. Используя это наблюдение, авторы разработали лёгкий предиктор простоя, который захватывает 86–90% общего времени ожидания и позволяет заранее принимать решения об управлении вычислительными ресурсами.

Полученные данные ставят под сомнение предположения, заложенные в современных системах обслуживания LLM. Исследователи подчёркивают, что инфраструктура, оптимизированная под чат-ботов, не подходит для агентных нагрузок, и необходима разработка специализированных решений — так называемой агент-нативной инфраструктуры.