EntropyMoE: новая архитектура Mixture-of-Experts для LLM без токенизатора

На arXiv опубликована статья, в которой предложена новая архитектура EntropyMoE для больших языковых моделей (LLM), работающих без токенизатора. Авторы предлагают использовать энтропию байтовых патчей для маршрутизации экспертов в архитектуре Mixture-of-Experts (MoE).

Современные байтовые LLM группируют байты в динамические патчи, что позволяет отказаться от традиционного токенизатора. Однако в существующих архитектурах каждый патч обрабатывается одинаковым плотным блоком feed-forward, что не учитывает разницу в семантике и гранулярности патчей.

EntropyMoE заменяет плотные модули в глобальном трансформере на слои Top-K экспертов. Основным элементом маршрутизации становится динамический байтовый патч: его байтовое покрытие учитывается при подсчёте нагрузки, а сам роутер выбирает экспертов на основе энтропии патча.

Авторы используют энтропию и длину патча как совместные признаки для регулирования специализации экспертов. Такой подход позволяет более гибко распределять вычислительные ресурсы в зависимости от сложности входных данных.

В экспериментах EntropyMoE достигла самого низкого показателя held-out bits-per-byte среди плотных и разреженных базовых моделей, сохранив при этом сопоставимую точность на downstream-задачах. Это подтверждает, что энтропия патча эффективна как координата для разреженных условных вычислений.

Исследователи отмечают, что результаты расширяют применение MoE-моделей за пределы представлений, основанных на токенизаторе. Это может быть полезно для дальнейшего развития моделей, работающих непосредственно с байтами.