Новый метод ECASQ повышает точность квантования при сжатии ИИ-моделей

Новый метод ECASQ повышает точность квантования при сжатии ИИ-моделей

Научная группа представила на arXiv новый подход к квантованию данных — ECASQ (Entropy-Constrained Adaptive Stochastic Quantization). Метод развивает недавнюю технику адаптивного стохастического квантования (ASQ), которая уже использовалась для снижения нагрузки на память и каналы связи при работе с большими моделями машинного обучения.

Классическое ASQ оптимизирует среднюю квадратичную ошибку для заданных входных данных и сохраняет несмещённость оценок. Это позволяет применять его для сжатия моделей, градиентов, KV-кэша и для поиска ближайших соседей. Однако на практике сжатые данные обычно дополнительно обрабатываются энтропийным кодером без потерь, и существующие методы не учитывают этот этап.

Авторы ECASQ предложили совместно выбирать адаптивные значения квантования так, чтобы минимизировать ошибку при ограничении на энтропию и сохранении несмещённости. Это, по замыслу исследователей, позволяет повысить точность по сравнению с ASQ без увеличения итогового размера данных.

Для решения задачи разработаны два алгоритма: точный динамический алгоритм с трудоёмкостью O(sd^2) по времени и O(d^2) по памяти для вектора длины d и не более s значений квантования, а также приближённый вариант, подходящий для GPU, с теми же временными затратами, но с памятью O(d). Приближение гарантирует, что его ошибка не превышает ошибку оптимального решения с энтропией на один бит меньше на элемент.

Дополнительно авторы предложили итеративную процедуру уточнения. В экспериментах она давала почти оптимальные результаты, сохраняя при этом заметное преимущество по скорости перед полным решением.

Развитие таких методов важно для снижения затрат на обучение и вывод больших моделей, а также для эффективного хранения и передачи данных в распределённых системах.