SpecDrop: маршрутизация без параметров повышает точность Mixture-of-Experts
Исследователи представили метод SpecDrop для архитектур Mixture-of-Experts (MoE). Он использует фиксированную маршрутизацию по категориям и не требует обученных параметров или дополнительных функций потерь. На тестах CIFAR-100 и ImageNet-1K SpecDrop превзошел сопоставимые по параметрам базовые модели.
В статье на arXiv авторы отметили, что стандартные обученные маршрутизаторы при равном бюджете параметров иногда уступают простым равновесным смесям. По их мнению, проблема не в алгоритме, а в соответствии гранулярности обучающего сигнала целевым категориям.
SpecDrop назначает каждой из K ветвей фиксированный вес для своей категории и небольшой «протечки» для остальных. Категория требуется только на этапе вывода. Это позволяет преобразовать метку в модульную структуру сети без дополнительного обучения.
На CIFAR-100 с ResNet-110 метод показал 79,23% точности, на ImageNet-1K с ViT-S/16 — 79,89%. Преимущество над плотной моделью составило +4,75 пункта, над контрольной No-Routing+SE — +6,53 пункта. При этом при использовании той же метки для маскирования выходов плотной модели она точнее по точности, но SpecDrop добивается 58% и 100% выравнивания ветвей и категорий.
На задачах с «размытыми» категориями, где единицы обучения охватывают несколько классов, преимущества SpecDrop нивелируются. На языковом моделировании SlimPajama-6B и инструктивной настройке SuperNI с Llama-3.2-1B метод показал результат на уровне контрольных моделей. Это подтверждает гипотезу авторов: важна согласованность гранулярности, а не выбор алгоритма.
Код метода опубликован на GitHub. Работа доступна на arXiv под номером 2608.04084.


