Новая архитектура LoKiFormer ускоряет предобучение больших языковых моделей в 1,33 раза

Группа исследователей представила архитектуру LoKiFormer, предназначенную для ускорения предобучения больших языковых моделей. Соответствующая работа размещена на платформе arXiv.

Авторы отмечают два основных недостатка существующих архитектур. Во-первых, механизм самовнимания не имеет явного индуктивного смещения на локальность, из-за чего избыточно моделирует внутренние локальные зависимости последовательности. Во-вторых, в смесях экспертов хранение знаний неявно связано с вычислительными путями, что ограничивает доступ к глобальной информации.

Предложенное решение состоит из двух дополнительных модулей. Модуль Local Fusion Attention внедряет свёрточное объединение в механизм внимания, что позволяет явно захватывать локальные паттерны и даёт вниманию возможность работать с более информативными представлениями.

Второй модуль Knowledge Memory представляет собой параметрическую память ключ-значение, которая хранит глобальные знания в отдельных адресуемых ячейках. Это разделяет хранение и вычисления, обеспечивая прямой доступ к знаниям.

По данным эксперимента, LoKiFormer сходится в 1,33 раза быстрее во время предобучения по сравнению с базовыми моделями. Это свидетельствует о более эффективной интеграции информации на локальном и глобальном уровнях.

Разработка может способствовать снижению вычислительных затрат на обучение больших моделей, что важно для практического применения ИИ.