ИИ-модели продемонстрировали умение оценивать собственную уверенность в медицинской диагностике

Научная группа представила на arXiv препринт, посвященный оценке метакогнитивных способностей больших языковых моделей (LLM) в медицинской диагностике. Авторы разработали контролируемый клинический бенчмарк, вдохновленный психофизическими методами, чтобы проверить не только точность ответов ИИ, но и то, насколько уверенность модели соответствует качеству доказательств.

В качестве клинической задачи выбрано дифференциальное диагностирование вероятного нейрокогнитивного расстройства альцгеймеровского типа (AT-NCD) и когнитивных нарушений, связанных с депрессией (DRCI). Эти состояния часто имеют схожую симптоматику, что делает задачу реалистичной и сложной для ИИ.

Для эксперимента сгенерировано 45 синтетических клинических сценариев, различающихся силой доказательств, наличием противоречащих данных и пропущенной информации. Каждый сценарий был представлен модели в трех вариантах промптов, всего 135 испытаний. В пилотном прогоне использовалась модель gpt-4.1-nano, и все испытания дали корректные структурированные результаты.

Показатели оказались неоднородными. Точность диагностики составила 93,5%, средняя уверенность — 78,4%, а показатель AUROC2 — 0,876. Уверенность модели росла при увеличении дистанции от границы диагностического решения, снижалась при нехватке информации и была выше на правильных ответах даже после поправки на силу доказательств и формат промпта. Это указывает на частичную метакогнитивную чувствительность, а не на глобально неинформативную уверенность.

Однако авторы выявили и зоны риска. Ошибки концентрировались в умеренных случаях с противоречивыми признаками AT-NCD: модель чаще смещалась к DRCI и сохраняла уверенность выше, чем оправдывала фактическая точность. По мнению исследователей, это демонстрирует локальные сбои калибровки, которые могут быть критичны при использовании ИИ в клинической практике.

Отдельно подчеркивается, что качество уверенности модели следует измерять напрямую, а не выводить из общей точности или мощности модели. Авторы предлагают воспроизводимый фреймворк для оценки чувствительности к доказательствам, метакогнитивной чувствительности и локализованных сбоев калибровки в медицинских LLM, что может стать основой для будущих стандартов тестирования ИИ в здравоохранении.