DC-Leap ускоряет диффузионные языковые модели до 105 раз без дообучения

Исследователи из академических институтов представили DC-Leap — новый фреймворк для ускорения работы диффузионных больших языковых моделей (dLLMs). Он не требует дополнительного обучения и позволяет радикально сократить время генерации текста.

Диффузионные LLM являются перспективной альтернативой авторегрессионным моделям, но их скорость работы часто ограничена избыточным числом итераций. Проблема связана с ошибкой совместной вероятностной зависимости (JPDE), которая заставляет модель использовать излишне консервативные пороги уверенности.

DC-Leap решает эту проблему с помощью стратегии динамического непрерывного верификации (Dynamic Contiguous Verification). Она интегрирует строгие причинно-следственные ограничения в процесс параллельного декодирования, последовательно проверяя зависимости между токенами. Это нейтрализует JPDE и позволяет ускорять работу при умеренном уровне уверенности.

Кроме того, фреймворк использует механизм декодирования с черновиком (draft-guided decoding). Черновик помогает расширять контекст, перепрыгивая через несколько токенов вперед, обеспечивая предварительный контекст и сохраняя структурные преимущества двунаправленного внимания.

Эффективность DC-Leap подтверждена экспериментами на стандартных бенчмарках. На тесте MBPP (генерация кода) достигнуто ускорение до 53,19 раз при генерации длинных последовательностей. В комбинации с KV-Cache ускорение достигает 105,02 раз, при этом качество генерации остается на уровне оригинальной модели.

Код фреймворка открыт и доступен на GitHub. Работа опубликована на arXiv в виде препринта. Новый метод может существенно ускорить применение диффузионных моделей в реальных задачах, от написания кода до обработки длинных текстов.