Новый метод MoCE ускоряет свёрточные сети и снижает вычисления на 16,7%

На arXiv опубликована работа, в которой исследователи представили новый подход к оптимизации свёрточных нейросетей — Mixture of Channel Experts (MoCE). Метод разработан как замена точечным (1x1) проекциям, которые используются для изменения числа каналов в сети.
Авторы отмечают, что прямое перенесение идеи Mixture-of-Experts (MoE) из трансформеров в свёрточные сети не даёт ожидаемого эффекта. Эксперты, работающие с одинаковыми входными каналами, быстро обучаются почти идентичным фильтрам, и выигрыш от специализации теряется.
В MoCE экспертом становится не отдельная ветвь операций, а выходной канал с разреженным набором входных каналов, число которых k значительно меньше полного размера C. Смешивание выбранных каналов происходит через softmax с температурой, которая предсказывается для каждого входа.
Метод также включает остаточный эксперт, который обрабатывает невыбранные каналы, и функцию потерь для балансировки нагрузки, чтобы все каналы использовались равномерно. Это позволяет сохранять полное покрытие информации.
Главное преимущество MoCE — снижение вычислительной сложности: вместо квадратичной зависимости от числа каналов стоимость растёт пропорционально k/C. Измерения на практике подтверждают снижение задержки и числа операций.
Эксперименты на архитектурах ResNet, CIFAR-100, EfficientViT и в задачах переноса обучения показали, что MoCE сопоставим или превосходит плотные версии и предыдущие методы выбора каналов. При этом количество умножений-накоплений снижается на 16,7%.







