Compound sparsity для LLM: статическое и динамическое сжатие вместе эффективнее
Большие языковые модели (LLM) часто сжимают либо статическим удалением параметров, либо динамическим пропуском вычислений на уровне токенов. Однако при агрессивном сжатии производительность резко падает за некоторым порогом разреженности. Новое исследование предлагает комбинировать оба механизма, чтобы отложить этот порог.
Авторы из EIT-NLP разработали минималистичную составную схему сжатия (compound sparsity). Она сначала применяет низкоранговую аппроксимацию и обрезку каналов для получения статически сжатой основы, затем добавляет легковесные маршрутизаторы для динамического пропуска слоёв по токенам. Такая архитектура позволяет независимо управлять разреженностью параметров и разреженностью вычислений на уровне токенов.
Эксперименты на бенчмарках понимания языка и моделирования показали, что составная разреженность последовательно превосходит однофакторные методы сжатия при одинаковой общей разреженности. Порог деградации на задачах понимания отодвигается, а качество моделирования сохраняется лучше.
Дополнительный анализ выявил интерференцию между обрезкой параметров и пропуском токенов. Оказалось, что наибольшая эффективность достигается при почти сбалансированном распределении бюджета разреженности между двумя измерениями.
Результаты демонстрируют, что составное сжатие — практичный способ улучшить компрессию LLM. В то же время работа показывает существование более широкой межразмерной границы разреженности, которая в конечном счёте ограничивает дальнейшее сжатие.
Исходный код планируется опубликовать в открытом доступе на GitHub. Исследование может быть полезно для разработчиков, стремящихся развернуть большие модели с минимальными потерями качества.






