Новый критерий предсказывает, когда выбор ответа по скрытым состояниям ИИ точнее голосования

Большие языковые модели часто отвечают на вопросы, генерируя несколько вариантов и выбирая из них с помощью большинства голосов. Однако на сложных заданиях такая стратегия ненадёжна: ответы содержат скоррелированные ошибки, и более частый неправильный вариант может победить, а добавление новых выборок лишь ухудшает решение.

Альтернативой является выбор кандидата на основе сигнала о правильности, считываемого из скрытых состояний модели. Такой подход работает нестабильно: его точность меняется в зависимости от модели и задачи, а заранее определить, можно ли ему доверять, было невозможно.

В новой научной работе, опубликованной на arXiv, представлен метод CASE (Correctness-Axis SElection). Он обучает линейный классификатор на скрытом состоянии токена ответа и выбирает кандидата с наибольшей оценкой. Главный вклад работы — критерий декодируемости, который без утечки данных показывает, насколько хорошо классификатор ранжирует правильные ответы выше неправильных.

Этот критерий позволяет заранее предсказать, будет ли скрытый выбор эффективнее голосования. На отложенных данных корреляция между предсказанием и реальным приростом точности достигла 0,75 по Пирсону, а порог для решения близок к значению AUC 0,60.

В экспериментах на общих и медицинских моделях CASE улучшал результаты по сравнению с голосованием до 19 процентных пунктов на вопросах средней сложности и до 16,8 пункта на сложных вопросах. При этом декодируемость зависела не от размера модели, а от согласованности знаний, которые модель должна вспомнить.

Предсказание по критерию переносится на новую научную область с отклонением в пределах 3,8 пункта. Это даёт практический способ заранее выбирать между обученным выбором по скрытым состояниям и обычным большинством голосов для конкретной модели и задачи.