Большие языковые модели быстрее накапливают ошибки: новый механизм риска
Исследователи из группы SEM Foreign RusNews ML представили на arXiv работу, в которой описан парадокс масштабирования языковых моделей: чем больше модель, тем точнее её ответы в среднем, но тем быстрее и катастрофичнее она ошибается. Авторы обнаружили скрытый авторегрессионный риск, который объясняет, почему даже уверенные в себе большие модели генерируют галлюцинации.
В основе работы лежит метрика per-position disagreement — разность логарифмов вероятностей, присваиваемых целевой моделью и более сильным оракулом той же семьи. Этот показатель разлагается на bias (квадрат расхождения KL) и риск (дисперсия). Анализ позволил выделить четыре ключевых результата.
Первый: при росте модели разрыв в знаниях (knowledge gap) уменьшается примерно в 6 раз, но деградация знаний (knowledge degradation) возрастает в 11–39 раз. То есть модель реже ошибается по незнанию, но её ошибки становятся более серьёзными и цепными.
Второй: в момент формирования ложного ответа энтропия модели (субъективная неуверенность) быстро снижается, но объективный риск, оценённый по оракулу, сохраняется в 17 раз дольше. Это создаёт «уверенный, но рискованный» режим, длящийся между соседними галлюцинациями (рост на 69% для модели 14B).
Третий: этот режим является причинным — применение on-policy, фиксированного по KL сокращения дисперсии снижает верифицированные галлюцинации на 35–74% в трёх семействах моделей. Это указывает на возможность практического купирования проблемы.
Четвёртый: скрытый риск структурно ускользает от самоконтроля модели. Детекторы, основанные только на вероятностях самой модели (например, семантическая энтропия), срабатывают примерно на 30% реже (p<10???) именно на той ветви, где возникает почти в 4 раза больше галлюцинаций. Таким образом, модель не может сама отследить собственное опасное состояние.
Исследование подчёркивает, что простое масштабирование не решает проблему надёжности, а в некоторых аспектах усугубляет её. Полученные результаты важны для разработки более безопасных систем ИИ и методов детекции ошибок.




