Qwen3-4B сжали до 1,64 бит на вес: размер вдвое меньше, точность упала

Специалисты представили в arXiv результаты эксперимента по сверхнизкобитовому сжатию инструкционно-настроенной модели Qwen3-4B. Пост-тренинговая конвертация, основанная на ротации KOTMS, тернаризации E2M-ATQ и компенсации ошибок в стиле GPTQ из библиотеки TWLA, позволила достичь 1,641 эффективного бита на весовой коэффициент для квантованных линейных слоёв.

Ключевая особенность подхода — вес-only: активации остаются в 16-битной точности, поэтому аппаратный оптимизатор ILA-AMP не использовался. Это упрощает задачу и фокусирует внимание на хранении и пропускной способности памяти, а не на ускорении арифметики.

Сравнение с исходной моделью показало неравномерное падение качества. В десяти оценённых задачах точность упала с 64,5% до 54,7%. При этом BoolQ сохранил 84,6% скорректированной производительности «учителя», тогда как ARC-Challenge — только 43,8%. Перплексия выросла на тестовых наборах: с 13,639 до 18,748 на WikiText-2, с 24,700 до 31,992 на PTB и с 19,831 до 28,966 на C4.

Отдельный этап — упаковка (packing) — сократил объём модели с 8,29 ГиБ до 3,96 ГиБ, сохранив тернарные плоскости и масштабы без изменения перплексии. Однако сторонняя попытка упаковки оказалась с потерями, поэтому она исключена из основного заявления об артефакте. Готовый упакованный вариант ещё не протестирован на точность задач и скорость генерации.

Авторы честно отмечают, что сжатие само по себе не ускоряет вывод. Предварительный микробенчмарк Triton GEMV на одной форме оказался в 4,6 раза медленнее, чем FP16 cuBLAS. Таким образом, работа демонстрирует потенциал 1,6-битного квантования для хранения, но ставит вопрос о практической пользе для инференса без дополнительной оптимизации.