GrowPage: новый метод управления KV-кэшем ускоряет рассуждения LLM без потери качества
На платформе arXiv опубликована работа, в которой представлена система GrowPage для оптимизации памяти при обслуживании больших языковых моделей (LLM). Особенность подхода — адаптивное управление так называемым KV-кэшем, который является основным узким местом при длительной генерации текста и выполнении рассуждений.
Стандартные методы сжатия KV-кэша обычно используют фиксированный бюджет на каждый запрос и решают только, какие элементы состояния сохранить. Однако потребность в памяти сильно меняется: разным запросам требуется разный объём, а в процессе одного запроса внимание модели перераспределяется. GrowPage рассматривает ёмкость кэша как ресурс, которым можно управлять во время выполнения.
Система поддерживает лёгкие сводки запросов двух масштабов: для учёта недавних и долгосрочных паттернов внимания. На их основе GrowPage оценивает динамику потребности в памяти. При каждом изменении границы ёмкости система либо сжимает ключи и значения в текущем выделении, либо запрашивает дополнительную физическую страницу, если возникает более широкий спрос на внимание.
Важно, что GrowPage интегрируется с абстракцией страниц PagedAttention, которая применяется во многих современных движках инференса. Это позволяет сохранить преимущества непрерывного батчинга и кэширования префиксов, что критично для реальных серверов.
Авторы протестировали систему на нескольких моделях и бенчмарках, связанных с рассуждениями. Результаты показывают улучшение компромисса между качеством ответов и пропускной способностью по сравнению с существующими подходами. Это может означать, что GrowPage позволит эффективнее обслуживать запросы, требующие длинных цепочек размышлений, без чрезмерного роста затрат на память.
Работа носит исследовательский характер и опубликована в виде препринта. Дальнейшие детали, включая исходный код и сравнение с другими методами, могут появиться в полной версии после рецензирования.



