Новая архитектура LoKiFormer ускоряет предобучение больших языковых моделей в 1,33 раза
Группа исследователей представила архитектуру LoKiFormer, предназначенную для ускорения предобучения больших языковых моделей. Соответствующая работа размещена на платформе arXiv.
Авторы отмечают два основных недостатка существующих архитектур. Во-первых, механизм самовнимания не имеет явного индуктивного смещения на локальность, из-за чего избыточно моделирует внутренние локальные зависимости последовательности. Во-вторых, в смесях экспертов хранение знаний неявно связано с вычислительными путями, что ограничивает доступ к глобальной информации.
Предложенное решение состоит из двух дополнительных модулей. Модуль Local Fusion Attention внедряет свёрточное объединение в механизм внимания, что позволяет явно захватывать локальные паттерны и даёт вниманию возможность работать с более информативными представлениями.
Второй модуль Knowledge Memory представляет собой параметрическую память ключ-значение, которая хранит глобальные знания в отдельных адресуемых ячейках. Это разделяет хранение и вычисления, обеспечивая прямой доступ к знаниям.
По данным эксперимента, LoKiFormer сходится в 1,33 раза быстрее во время предобучения по сравнению с базовыми моделями. Это свидетельствует о более эффективной интеграции информации на локальном и глобальном уровнях.
Разработка может способствовать снижению вычислительных затрат на обучение больших моделей, что важно для практического применения ИИ.






