Исследователи улучшили гибридные трансформеры с помощью новой архитектуры HwH

В статье на arXiv описана проблема: гибридные архитектуры, которые объединяют полное внимание и линейное внимание, становятся всё популярнее, однако распределение этих механизмов по слоям и головам часто выбирается эвристически. Авторы попытались найти научное обоснование для такой разбивки.

Они исследовали внутреннее устройство моделей на основе RoPE-позиционных кодировок, включая серию Qwen3 и Llama3.1. Для этого были предложены два показателя: RFIS и RPD. Эти метрики позволили выделить два типа голов внимания — поисковые и позиционные, разделённые характерной полосой частот.

Эту полосу авторы назвали Global Positional Band. С помощью управляемых экспериментов они показали, что граница между типами голов связана с масштабом позиционных данных, использованных при обучении. По мнению исследователей, это может объяснять проблемы нулевой экстраполяции длины контекста.

На основе наблюдений сформулированы два принципа: позиционное моделирование должно работать только локально, а глобальный доступ к информации должен обеспечиваться через механизмы, независимые от позиции. Кроме того, функции следует назначать на уровне отдельных голов внимания с учётом слоя.

Эти принципы воплощены в архитектуре HwH. В ней глобальный поиск выполняет полное внимание без позиционного кодирования, а локальное позиционное моделирование — линейное внимание. При этом доля полного внимания к линейному составляет менее 1:3.

Эксперименты показали, что HwH сохраняет высокое качество языкового моделирования и здравого смысла, одновременно улучшая поиск информации и заметно усиливая способность к экстраполяции на длинные контексты по сравнению с обычным Transformer, LA и послойными гибридными решениями.

Авторы подчёркивают, что эти результаты открывают путь к более принципиальному проектированию гибридных архитектур, которые могут стать основой для будущих фундаментальных моделей.