Новый алгоритм сжатия LLM объединяет важность нейронов и низкоранговую аппроксимацию
Большие языковые модели (LLM) содержат миллиарды параметров, что требует огромных ресурсов памяти и ограничивает их применение на устройствах с низкой производительностью. Для решения этой проблемы исследователи активно разрабатывают методы сжатия нейросетей.
Одним из распространенных подходов является сингулярное разложение (SVD), которое позволяет сжимать матрицы весов. Однако предыдущие работы фокусировались либо на важности параметров, либо на функциональной эквивалентности слоев, рассматривая эти аспекты по отдельности.
В новой работе, опубликованной на arXiv, авторы предлагают комбинировать оба подхода в единой целевой функции. Это позволяет минимизировать ошибку сжатия и сохранить эффективность модели на целевых задачах.
Кроме того, важным фактором является распределение степени сжатия по слоям и параметрам. Ранее сжатие часто распределяли равномерно или использовали дорогостоящий эвристический поиск. В новом методе предложен вычислительно эффективный алгоритм динамического распределения степени сжатия.
Эксперименты показали, что предложенный подход работает на уровне или значительно лучше предыдущих методов, особенно при высоких коэффициентах сжатия. Результаты подтверждают эффективность объединения важности нейронов и низкоранговой аппроксимации.
Разработка открывает новые возможности для развертывания мощных языковых моделей на устройствах с ограниченными ресурсами, что актуально для мобильных приложений и встраиваемых систем.



