Новый метод OptR улучшает INT2-квантование KV-кэша в длинноконтекстных LLM
Кэш ключей и значений (KV-кэш) становится главным узким местом инференса больших языковых моделей при работе с длинными контекстами. Он требует значительного объёма памяти и пропускной способности, поэтому исследователи всё чаще обращаются к сверхнизкобитному квантованию, в том числе к 2-битному формату INT2.
Однако существующие методы ротационного квантования оптимизируют статистику кэша или промежуточные ошибки до полного чтения внимания. При этом фактическая ошибка, влияющая на выход модели, возникает после прохождения через механизм внимания и выходную проекцию W_O. Авторы новой работы указывают на это несоответствие целей.
Предложенный ими метод OptR (output-aware rotation) минимизирует именно ошибку на выходе после проектора W_O. Ошибка раскладывается на компоненты, связанные с ключами и значениями, после чего для каждого внимания подбираются ортогональные корректировки с учётом полного пути INT2-квантования и внимания.
Дополнительно OptR применяет эквивалентное переопределение ключей, которое уменьшает большие межканальные смещения без изменения распределения softmax. Это позволяет стабилизировать квантование и снизить потери точности.
В экспериментах на трёх моделях и пяти бенчмарках, включая задачи на рассуждения и программирование, OptR стабильно улучшает показатели существующих подходов QuaRot и OSCAR. Также метод усиливает извлечение информации из длинных контекстов.
При этом сохраняется форма пейджингованного KV-кэша, а дополнительные вычислительные затраты на инференсе оцениваются как незначительные. Это приближает использование 2-битного квантования на практике, где важен баланс между экономией памяти и качеством ответов модели.




