Новый метод BF1 ускоряет длинноконтекстные трансформеры: до 10,91x на слое при 32K токенов

Исследователи представили BF1 — новый метод разреженного внимания для трансформеров, работающих с длинными контекстами. Подход сочетает небольшое точное локальное окно, глобальный первый блок и логарифмически распределённые исторические блоки. Это позволяет сократить число взаимодействий токенов до O(n log n) при фиксированной ширине блока.
Метод разработан как ретрофит для уже обученных моделей. Авторы проверили корректность преобразования слоёв и сопоставили скорость работы с плотным вниманием. На видеокарте NVIDIA RTX PRO 6000 Blackwell BF16-реализация BF1 обгоняет плотное внимание на длинах от 2K до 4K токенов, а на 32K даёт ускорение предзаполнения в 10,91 раза на слой.
Практический тест провели на модели Qwen3-0.6B. Когда восемь из 28 слоёв внимания заменили на BF1, время до первого токена сократилось на 7,7%, 11,3% и 15,3% при контекстах 8K, 16K и 32K соответственно. Остальные плотные слои сохраняют модель асимптотически квадратичной, но заметно снижают задержку.
Авторы также сравнили BF1 с несколькими альтернативами по качеству языкового моделирования. В протоколе адаптации на 16,384 млн токенов за 1000 шагов BF1 показал среднюю перплексию 1,68639, опередив статическую случайную нелокальную схему (1,69154), плотное продолженное обучение (1,69258) и локальное скользящее окно с равным бюджетом (1,81505).
По сообщению исследователей, BF1 воспроизводим и может применяться как оператор разреженного внимания, так и как селективный компонент для частичного ретрофита больших моделей. Работа опубликована в архиве препринтов arXiv и включает оценку числовой корректности, масштабирования выбранных взаимодействий, производительности ядер и качества генерации.







