Исследователи улучшили оценку уверенности чёрных ящиков LLM без доступа к их внутренностям

На arXiv опубликована новая работа, посвящённая оценке неопределённости больших языковых моделей (LLM). Авторы предлагают улучшать существующие методы оценки уверенности с помощью простых классификаторов, которые предсказывают, ошиблась ли модель в ответе.

Современные подходы к количественной оценке неопределённости, такие как вербализованная уверенность или методы, требующие нескольких генераций, обычно работают в режиме zero-shot. Это значит, что они дают оценку без использования размеченных данных, но на практике перед развёртыванием модели всё равно приходится проверять их на конкретном датасете.

Исследователи показывают, что если использовать этот датасет, можно стабильно обойти базовые показатели. Их метод строится на простых классификаторах: на вход подаются существующие показатели уверенности и информация о том, насколько правильными были ответы на похожие запросы. На выходе модель получает более точный прогноз собственной ошибки.

По словам авторов, дополнительная вычислительная нагрузка минимальна. Это делает предложенный способ дешёвым и практичным улучшением для систем, где важно понимать, когда модель может дать неверный ответ, — от чат-ботов до автоматизированных ассистентов.

Работа выложена на arXiv под идентификатором 2608.19323 и относится к категории машинного обучения (cs.LG).