ИИ знает об ошибках, но молчит: зонды видят проблемы, а уверенность моделей — нет

Новое исследование, опубликованное на arXiv, показало парадоксальный эффект в работе больших языковых моделей: внутренние линейные зонды обнаруживают искажения в контексте с почти идеальной точностью, однако эта информация не помогает предсказать, ошибётся ли модель в финальном ответе. Авторы называют это разрывом между знанием и говорением.

В ходе экспериментов на многошаговых арифметических цепочках зонды, обученные распознавать испорченный контекст, оказались бесполезны для определения корректности итогового результата. При этом модели, вынужденные выдавать уверенность в строгом структурированном формате, схлопывали свои оценки до двух значений, у которых уровень ошибок был практически неразличим.

Особое внимание уделено проверке предварительно зарегистрированной гипотезы persistence beats peak, согласно которой устойчивость сигнала зонда через несколько шагов должна лучше разделять правильные и неправильные ответы. Гипотеза не подтвердилась: сохранение активности зонда на разных шагах не отделяло верные исходы от ошибочных.

Закономерность воспроизводится на нескольких семействах моделей, включая специализированные reasoning-модели. Это говорит о том, что разрыв носит системный характер, а не является артефактом одной архитектуры.

Практическая часть исследования касается мониторинга в реальном времени. Оказалось, что вмешательства на основе зондов сильно зависят от модели и типа ошибки. Например, стратегия branch-and-pick показала положительный эффект на всех моделях и оказалась единственной, не ломающей работу Llama-3.1-8B: она спасла четыре ошибочных ответа и не испортила ни одного правильного.

Другие подходы, такие как reprompt и replace-prior, ломают правильные цепочки примерно с той же частотой, с какой исправляют неверные. Это означает, что универсального решения нет: эффективный мониторинг требует маршрутизации с учётом конкретной модели и типа ошибки.

Авторы делают вывод, что зонды являются необходимым дополнением к вербализованной уверенности, но не заменяют её. В итоге для надёжного развёртывания ИИ нужна модель-aware и error-type-aware маршрутизация, а не единое вмешательство на все случаи.