RRQ: один чекпоинт LLM даёт 2-, 4-, 6- и 8-битные версии модели

Разработчики из arXiv представили новый метод пост-обучения квантованию Recurrent Residual Quantization (RRQ) для больших языковых моделей (LLM). Подход решает проблему гибкого выбора между точностью, памятью и пропускной способностью при развёртывании моделей в разных условиях.

Традиционные методы квантования требуют отдельного чекпоинта для каждой целевой битовой ширины. RRQ позволяет обойти это ограничение: веса представляются как низкобитная основа вместе с последовательностью квантованных остаточных поправок. Это даёт несколько эффективных точностей из одного сохранённого состояния модели.

Метод работает так: сначала берётся 2-битная модель, полученная через пост-обучение или округление до ближайшего (RTN). Затем RRQ последовательно добавляет лёгкие 2-битные остатки, также сгенерированные через RTN, формируя 4-, 6- и 8-битные представления. Важно, что подход не требует калибровки и избегает совместной многобитовой оптимизации.

В тестовой конфигурации с Qwen3-8B полный пакет 2-/4-/6-/8-битных версий был собран за 1293 секунды. Это в 3,3 раза быстрее, чем измеренная сборка MatGPTQ. Авторы отмечают, что такой выигрыш во времени делает метод практичным для быстрого экспериментирования и промышленного использования.

Эксперименты на шести недавних LLM показали конкурентоспособную точность на 6 и 8 битах. На 4 битах результаты зависят от конкретной модели, что указывает на необходимость выбора оптимальной точности под задачу. Код метода будет открыт после публикации.

Практическая ценность RRQ — в снижении затрат на хранение и обслуживание нескольких версий модели. Вместо четырёх отдельных копий достаточно одного чекпоинта, что упрощает развертывание и позволяет динамически переключаться между требуемой точностью и скоростью.