Представлен CurveFP: формат чисел для ИИ, который ускоряет обучение и снижает затраты

Представлен CurveFP: формат чисел для ИИ, который ускоряет обучение и снижает затраты

Группа исследователей опубликовала на arXiv описание нового семейства форматов чисел с плавающей запятой под названием CurveFP. Разработка предназначена для языковых моделей и направлена на снижение вычислительных затрат без потери качества.

Традиционные низкоточные форматы, такие как FP8, уменьшают стоимость, но фокусируются на точности отдельных чисел, оставляя арифметику произведений неизменной. CurveFP решает эту проблему иначе: он использует замкнутые произведения, распределяя квантованные величины по перемежающимся логарифмическим кривым под компактными блочными масштабами.

Ключевая особенность — рациональное основание, которое настраивает динамический диапазон против локального разрешения. Умножение при этом превращается в точную операцию XOR знака и обновление целочисленного индекса, что существенно упрощает аппаратную реализацию.

Предложено два варианта: CurveFP eight (E4C3/E5C2) для обучения и CurveFP seven (E3C3) для компактного развертывания. Второй вариант использует всего семь бит для хранения числа, что меньше, чем у стандартного FP8.

В тестах CurveFP seven превзошел тензорный FP8 по перплексии на четырех моделях размером от 7 до 9 миллиардов параметров, имея на один бит меньше. Отклонение от нативного качества составило не более 1,32 процента.

CurveFP eight показал снижение нормализованной среднеквадратичной ошибки операндов во всех 36 парных сравнениях прямого и обратного GEMM. На трех сопоставимых моделях с 128,3 миллионами параметров каждая все режимы завершили претрейнинг на 3 миллиарда токенов на сид, а средняя перплексия при BF16-инференсе составила 22,5366 против 22,5407 у FP8.

Дополнительная проверка на 36 downstream-задачах показала, что чекпоинты, обученные с CurveFP eight, дают более низкую перплексию на WikiText-103 во всех 12 сравнениях seed-формат. По PG-19 и другим задачам разница была смешанной.

Таким образом, CurveFP объединяет поведение уровня FP8, семибитовый инференс и более простой путь перемножения, что делает его перспективным кандидатом для эффективного обучения и развертывания больших языковых моделей.