Сжатие MoE-моделей: LorExperts сохраняет точность без переобучения роутера

В архиве препринтов arXiv появилась работа, описывающая новый способ сжатия больших языковых моделей на архитектуре Mixture-of-Experts (MoE). Метод получил название LorExperts, а его расширенная версия — BTExperts. Предложенный подход нацелен на снижение стоимости развертывания таких моделей без потери качества.

Современные MoE-модели содержат множество экспертов — специализированных компонентов, которые активируются выборочно. Это дает высокую производительность при ограниченных вычислительных ресурсах, однако сами весовые матрицы экспертов занимают много памяти. Для практического применения их приходится сжимать, и существующие методы часто требуют переобучения роутера или заметно проигрывают в точности при росте числа экспертов.

Авторы LorExperts обратили внимание, что веса экспертов почти ортогональны друг другу, из-за чего простые общие низкоранговые представления, как в методе D^2-MoE, перестают работать при увеличении количества экспертов. При этом эксперты образуют функциональные группы, связанные по совместной активации, а не по похожести весов. На этом наблюдении и построен новый метод.

LorExperts кластеризует экспертов, внутри каждого кластера выбирает одного доминантного эксперта, который сохраняется полностью, а остальные члены кластера представляются как низкоранговые поправки к нему. Все эксперты и исходный роутер остаются на месте, переобучение роутера не требуется. Это позволяет применять сжатие без вмешательства в архитектуру модели.

В экспериментах на моделях Qwen3-30B-A3B и Gemma-4-26B-A4B при сокращении веса экспертов примерно на 50% LorExperts показал более высокую точность и лучшую перплексию по сравнению с базовыми методами на большинстве задач. Отдельно отмечено, что выигрыш над D^2-MoE увеличивается с ростом числа экспертов в модели.

Кроме того, исследователи предложили процедуру реконструкции для дополнительной тонкой настройки, а также вариант BTExperts, где доминанты и поправки организованы в виде дерева. Такая структура позволяет амортизировать общие вычисления при выводе и ускорить работу модели.

Появление эффективных методов сжатия MoE-моделей важно для практического внедрения больших языковых моделей на ограниченном оборудовании. Умение сокращать экспертов без потери точности и без сложного переобучения снижает барьеры для использования таких моделей в реальных сервисах и приложениях.