Учёные: нейросети обретают симметрии, позволяющие сжимать их до 17% размера

В новом препринте на arXiv (2609.01768) исследователи описали, что обучение глубоких нейросетей порождает локальные симметрии, известные в теории графов как фибрации и накрытия. По мнению авторов, такие структуры возникают закономерно, а не являются случайным артефактом.

Теоретическая часть работы доказывает, что накрывающие симметрии выступают устойчивыми аттракторами стохастического градиентного спуска. Это означает, что в ходе оптимизации нейросеть стремится к состояниям с определённой симметричной структурой. Гипотеза подтвердилась на нескольких типах архитектур: полносвязных, свёрточных, рекуррентных и трансформерах.

Один из ключевых практических результатов — возможность сильного сжатия моделей. Авторы сообщают, что использование обнаруженных симметрий позволило сократить нейросети до 17% от их исходного размера без потери производительности. Это может упростить развёртывание искусственного интеллекта на устройствах с ограниченными вычислительными ресурсами.

Второе важное применение связано с непрерывным обучением. Контролируемое нарушение накрывающей симметрии помогает преодолеть потерю пластичности — проблему, при которой модель хуже осваивает новые задачи после предыдущих этапов обучения. Предложенный подход продемонстрировал конкурентоспособные результаты в этой области.

Авторы считают, что симметрийный взгляд на искусственные нейросети способен превратить их из «чёрного ящика» в интерпретируемые графы. Такое представление может упростить анализ внутреннего устройства алгоритмов и дать толчок к созданию более эффективных систем для инференса и обучения в течение всей жизни.