Оптимальный размер словаря для LLM варьируется от 32 тыс. до 524 тыс. в зависимости от нагрузки — исследование

Размер словаря токенизатора — одно из ключевых решений при создании больших языковых моделей, однако обычно его фиксируют на этапе обучения, опираясь на сложившиеся практики, а не на анализ будущей эксплуатации. Исследователи из arXiv (препринт 2608.11361) предложили рассматривать этот параметр как элемент инфраструктуры, который должен подбираться под конкретный сценарий развертывания.

В работе формализована полная стоимость жизненного цикла модели: она складывается из затрат на обучение и на инференс, причем последние зависят от объема обращений и размера батча. Авторы показали, что оптимальный размер словаря не является константой, а меняется в зависимости от режима работы.

Эксперименты проводились на двух семействах GPU — A10G и A100, охватывающих диапазон от memory-bound до compute-bound задач. Выяснилось, что при батче размером 1 оптимальный словарь составляет 32 тыс. токенов, а при батче от 64 и выше — уже 524 тыс. Таким образом, сдвиг происходит в 16 раз.

При этом качество модели, измеряемое в битах на байт (BPB), почти не меняется во всем диапазоне: разброс менее 2%. В моделях масштаба 1.3–2.3B параметров наилучший результат достигается при словаре в 65 тыс., что подтверждает зависимость предпочтений от масштаба.

Авторы подчеркивают, что выбор размера словаря — это чисто системная оптимизация, не требующая жертвовать качеством. Они формулируют практические рекомендации для планирования мощностей: для мобильных устройств (батч 1) стоит использовать словарь около 32 тыс., а для серверных развертываний с высоким трафиком и большим батчем — от 131 до 262 тыс.

Эти выводы могут помочь инженерам точнее оценивать потребности в памяти и вычислительных ресурсах на этапе проектирования модели, избегая как избыточных затрат, так и деградации скорости инференса. Полный текст исследования доступен на arXiv.