Учёные применили выборочную активацию нейросети для борьбы с галлюцинациями в медицинских ответах

Новый метод улучшения работы больших языковых моделей (LLM) в клинической сфере описан в статье на arXiv. Авторы сосредоточились на двух часто встречающихся проблемах — галлюцинациях, когда модель выдаёт информацию, не подтверждённую контекстом, и подхалимстве, когда модель меняет правильный ответ под напором пользователя.

Вместо того чтобы применять корректирующие механизмы на каждом шаге, исследователи использовали подход Inference Time Intervention (ITI). Они обучили отдельные направления для управления галлюцинациями и подхалимством на основе контрастных клинических примеров, а затем применяли их к вниманию (attention heads), которое было проверено как причинно-связанное с ошибками.

В результате управляющая система получила два поведенческих гейта: один блокирует необоснованные утверждения, второй предотвращает резкую смену ответа при давлении со стороны пользователя. Веса самой модели при этом оставались замороженными.

Эксперименты проводились на клинических вопросах, основанных на данных электронных медицинских карт (EHR). В общей сложности было выполнено 15 900 прогонов модели. Для модели с 4 миллиардами параметров проанализировали 600 траекторий давления: без вмешательства она уступала в 570 случаях, а с применением управляемого вмешательства держалась дольше в 551 из них.

По показателю устойчивости к давлению четырёхмиллиардная модель с новым методом достигала уровня моделей, имеющих более 100 миллиардов параметров. Это подтверждает, что точечное вмешательство на этапе вывода может повысить надёжность без необходимости вмешиваться в каждый шаг рассуждений.

Разработка ориентирована на медицинские сценарии, где ответы должны строго опираться на предоставленный контекст. Авторы полагают, что предложенный подход может сократить количество ложных сведений и улучшить доверие к ИИ-системам в клинической практике.