Доменно-условное смещение позиции улучшает старт языковых моделей до 27%
Авторегрессионные языковые модели демонстрируют наименьшую точность в начале последовательности из-за отсутствия контекста. Исследователи из arXiv представили метод domain-conditional position offset — обучаемый вектор, добавляемый к эмбеддингам первых позиций, который снижает этот эффект без изменения весов модели.
Метод обучается за несколько минут на примерно сотне документов и легко переключается между доменами без дополнительного состояния. Он не добавляет задержки при инференсе, что делает его привлекательным для практического применения.
Эксперименты проводились на восьми моделях Mamba, GPT-NeoX и Llama с числом параметров от 410 млн до 8 млрд. Для всех моделей достигнуто снижение перплексии на удержанных доменах до 27%. Эффект сохраняется и для модели с 70 млрд параметров, причём большая часть выигрыша достигается добавлением всего одного вектора.
Для сравнения: прямая коррекция логитов дала улучшение не более 7,9% и не влияла на последующие токены. LoRA-дообучение достигает более низкой перплексии, но требует в 100–1000 раз больше параметров. Soft prompts, в свою очередь, добавляют новые токены в последовательность.
Метод показал улучшение в задачах реранжирования результатов поиска и доменной классификации, когда решение зависит от начальных токенов. Для задач few-shot рассуждения, где сигнал находится позже, результаты остались без изменений.
Применение смещения при префильной генерации (prefill) также улучшило качество текста, тогда как наивное применение на каждом шаге декодирования приводило к повторениям. Авторы характеризуют метод как лёгкий и «горячо переключаемый» инструмент для быстрой адаптации модели к домену.


