Исследователи предложили метод SARE для оценки усилий ИИ в цепи рассуждений

Исследователи представили новый подход к анализу работы больших языковых моделей (LLM) в задачах цепочки рассуждений. Метод получил название Step-Aware Reasoning Energy (SARE) и позволяет оценивать, сколько вычислительных усилий модель тратит на каждый отдельный шаг рассуждения, а не только на весь процесс в целом.

Как отмечается в статье на arXiv, традиционные методы интерпретации либо полагаются только на выходной текст, либо усредняют обработку по всей цепочке, что скрывает внутреннюю динамику. SARE использует геометрический подход: для каждой пары соседних слоев трансформера вычисляется выравнивание CKA между грам-матрицами скрытых состояний токенов. Это позволяет уловить структуру связей между токенами без необходимости выравнивания собственных векторов или соответствия кластеров.

Новая метрика также учитывает семантический контекст: траектория рассуждений рассматривается как переходы между латентными семантическими состояниями. Благодаря этому энергия рассуждений сопоставляется с продвижением мыслительного процесса, а не только с механической обработкой символов.

Эксперименты проводились на шести бенчмарках для рассуждений и трех моделях с открытым весом. Результаты показали, что энергия рассуждений распределена крайне неравномерно между типами шагов и демонстрирует фазовые переходы, которые не видны при использовании метрик уровня траектории.

Особый интерес вызывает связь между внутренней геометрической динамикой и корректностью ответа. Как выяснили авторы, ошибочные траектории систематически показывают более низкий уровень энергии на критических переходах рассуждений. Это открывает возможность использовать SARE для раннего обнаружения потенциальных сбоев.

Кроме того, признаки на основе SARE не уступают или превосходят базовые показатели уверенности, получаемые из выходных данных, в большинстве рассматриваемых настроек. Это указывает на то, что внутренние геометрические характеристики кодируют дополнительную прогностическую информацию, недоступную при анализе только поверхности ответа.

Разработка может быть полезна для улучшения интерпретируемости LLM, диагностики ошибок и создания более надежных систем рассуждений. Авторы подчеркивают, что метод не требует внешнего выравнивания или априорных знаний о структуре задачи, что упрощает его применение на практике.