HeadWiseKV: новый метод сжатия KV-кэша ускоряет длинноконтекстные ИИ-модели
Растущий KV-кэш при инференсе длинных контекстов остаётся узким местом для языковых моделей: он занимает значительный объём видеопамяти и снижает пропускную способность генерации. Проблема актуальна и для гибридных архитектур, где глобальные слои внимания продолжают доминировать в потреблении памяти. Новый метод HeadWiseKV предлагает решать её путём бюджетного распределения резидентности кэша по отдельным головкам внимания.
Разработчики описывают HeadWiseKV как training-free фреймворк, который сжимает остаточные глобальные KV-кэши гибридных моделей, не затрагивая их локальные, рекуррентные и линейные пути. Каждая физическая KV-головка получает статическое многоуровневое окно истории, благодаря чему потребность в кэше становится предсказуемой до начала обслуживания.
В основе метода лежит алгоритм SeqCalib, который рассматривает распределение памяти как ограниченную операционную задачу скорости-искажения. SeqCalib обрабатывает слои в порядке их выполнения и учитывает политику нижележащих слоёв, использованную при развёртывании. Это позволяет принимать во внимание взаимодействия между слоями по глубине модели.
Для практической реализации используется grouped-cache runtime: выбранная политика материализуется как фактическая резидентность KV-головок, а не как маска поверх полного кэша. Такой подход упрощает интеграцию в существующие системы и делает поведение модели более детерминированным.
Эффективность HeadWiseKV проверена на четырёх гибридных длинноконтекстных моделях. По данным исследователей, метод сохраняет качество, близкое к полноразмерному KV-кэшу, в тестах RULER и LoCoMo. В системном исследовании с фиксированной моделью Qwen3.6-27B удалось снизить пиковое потребление памяти устройства на 8,59% при контексте 112K токенов.
Кроме того, HeadWiseKV позволил увеличить максимальный успешно обработанный контекст со 114K до 161K токенов при тех же аппаратных ограничениях. Авторы отмечают, что предсказуемый бюджет кэша упрощает планирование ресурсов при обслуживании моделей с очень длинными входами.
Несмотря на то, что работа носит академический характер, предложенный подход потенциально применим в продакшн-системах, где стоимость GPU-памяти критична. Дальнейшее развитие метода может включать адаптивные политики для разных типов задач и архитектур.



