Метод CORA-Diff ускоряет диффузионные языковые модели до 13 раз без потери качества

Научный препринт, опубликованный на arXiv, описывает новый подход к ускорению работы диффузионных языковых моделей (DLM). Метод получил название CORA-Diff — Confidence-Oriented Residual Acceptance. Авторы предлагают сокращать вычислительные затраты, не изменяя архитектуру модели и не требуя дополнительного обучения.

Проблема, которую решают исследователи, связана с особенностью декодирования DLM. Такие модели обновляют множество токенов параллельно, но на практике декодеры часто используют фиксированное число шагов шумоподавления. Многие предсказания стабилизируются раньше, однако поблочное декодирование продолжается, пока не будут разрешены все позиции, что приводит к повторным плотным прямым проходам.

CORA-Diff анализирует сигналы траектории модели — уверенность и устойчивость предсказаний — и применяет специальные фильтры только к тем позициям, которые остаются неопределёнными. Принятые токены остаются видимыми как контекст, а блок завершается, когда все позиции разрешены. Метод не изменяет исходное правило трансфера и не требует модификации логитов.

Эксперименты проводились на наборе GSM8K для калибровки и затем на нескольких задачах. В протоколе, аналогичном Learn2pd-style LLaDA, CORA-Diff показал наименьшее время выполнения во всех восьми настройках длины задач. Качество ответов в пяти настройках совпало или превзошло плотное декодирование, а максимальное падение составило 1,22 пункта.

Прирост скорости по сравнению с плотным декодированием с учётом EOS составил 2,70 раза на GSM8K и 3,32 раза на HumanEval. В режиме изоляции механизма с фиксированным горизонтом 1024/1024 ускорение достигло 13,14 раза. Кроме того, метод переносится на модель Dream без перенастройки, обеспечивая ускорение 3,18–3,53 раза.

По мнению авторов, результаты показывают, что внутренние сигналы уверенности и устойчивости позволяют надёжно определять остаточные позиции, сокращая повторные вычисления при сохранении качества. Это важно для практического применения диффузионных языковых моделей, которые требуют значительных ресурсов на этапе генерации.