В LLM нашли «направление незнания»: оно отвечает за ответы при недостатке данных
Исследователи опубликовали на arXiv препринт, в котором описали внутренний механизм больших языковых моделей (LLM), активирующийся при недостатке информации. Авторы обнаружили в геометрии декодера особый вектор, названный «направлением незнания». Он отвечает за то, как модель формирует прогноз, когда входные данные малоинформативны.
Оказалось, что одно из направлений в unembedding-матрице модели кодирует униграмное распределение обучающего корпуса — то есть частотность отдельных слов в текстах. Это распределение работает как байесовский априор, к которому LLM обращается в ситуациях неуверенности. Такая структура выявлена во всех четырех семействах моделей: Llama, Qwen, Gemma и Pythia, с размерами от 0,4 млрд до 405 млрд параметров.
Ключевой результат — возможность измерить степень влияния этого априора на конкретный ответ. Проецируя финальное состояние предсказания на «направление незнания», авторы получили коэффициент ? (лямбда), который назвали фактором загрузки априора. Эмпирически этот коэффициент снижается по мере того, как контекст становится более информативным.
Формально такая проекция разлагает состояние предсказания на две ортогональные составляющие. Они соответствуют двум элементам темперированного байесовского обновления: униграмный априор, возведенный в степень ?, и контекстно-зависимое правдоподобие. Это дает геометрическую интерпретацию тому, как LLM сочетают предыдущие знания и новую информацию.
Предложенная модель позволяет калибровать ? так, чтобы его можно было сравнивать между моделями разного размера и архитектуры. Авторы отмечают: более крупные модели в целом демонстрируют меньшую зависимость от априора при наличии насыщенного контекста. Это соответствует ожиданию, что большие сети лучше используют поступающую информацию.
Особый интерес представляет причинный характер найденного механизма. Эксперименты показали: если искусственно повышать или понижать ? в финальном состоянии предсказания, ответ модели сдвигается к униграмному априору или от него. Сдвиг измеряется по KL-дивергенции, что подтверждает прямую управляемость процессом.
Практическая значимость работы — в возможности лучше понимать и контролировать степень уверенности LLM. Предложенный подход может помочь при разработке методов борьбы с галлюцинациями и настройки моделей под задачи, где важна осторожность при недостатке данных.


