Квантование ИИ-моделей: повреждения оказались мультипликативными, а не аддитивными

В новой научной работе, опубликованной на arXiv, показано, что повреждения от квантования больших языковых моделей носят мультипликативный, а не аддитивный характер. Это означает, что квантование не просто добавляет шум фиксированного размера к уверенности модели, а умножает её на коэффициент, зависящий от битности.

Квантование — это процесс снижения точности весов модели для экономии памяти и ускорения вычислений. Обычно модели разворачивают с битностью ниже четырёх, и известно, что это ухудшает качество. Однако до сих пор оставалось неясным, какие именно решения модели изменятся при конкретной битности и почему.

Авторы измерили так называемый запас решения (margin) для 16 моделей из 8 семейств, используя три метода квантования и битность от 8 до 2 бит. Margin — это разница между оценкой выбранного варианта и лучшей альтернативы. Оказалось, что квантование не добавляет фиксированный шум, а умножает margin на коэффициент, который сжимается с уменьшением битности: медианное значение 0.86 при 4 битах, 0.33 при 3 битах и 0.00 при 2 битах.

Это сжатие снижает защиту, которую даёт большой исходный запас, и даже небольшие внутренние смещения модели могут определять направление отказа. Например, при 3 битах решение о вызове инструмента разрушается в сторону бездействия, тогда как выбор конкретного инструмента остаётся нетронутым.

Исследователи провели статистическое сравнение: модели аддитивного шума никогда не побеждают на повреждённых решениях, связанных с вызовом инструментов и безопасностью. Предложенная ими мультипликативная зависимость предсказывает частоту переключений решений с медианной ошибкой 1.8 процентных пункта на отделённых данных, хотя эта зависимость была подогнана без их использования.

Форма зависимости оказалась одинаковой для всех измеренных моделей, но конкретные коэффициенты индивидуальны и не переносятся между моделями. Авторы предлагают метод оценки повреждений с помощью небольшого парного набора измерений margin для каждой модели и битности, что позволяет прогнозировать, какие решения сломаются, без полной генеративной оценки. По их расчётам, ничто не восстанавливает качество дешевле, чем добавление одного дополнительного бита.

Работа важна для практиков, которые разворачивают модели на устройствах с ограниченными ресурсами: она позволяет точнее предсказывать потенциальные сбои и выбирать оптимальную битность для каждой конкретной задачи.