Ученые нашли способ выявлять ложь в текстах с помощью активаций языковых моделей

Проблема распространения ложной информации в интернете стимулирует поиск эффективных способов автоматического факт-чекинга. Большинство существующих решений либо опираются на поверхностные лингвистические признаки, либо обращаются к внешним базам знаний. Группа исследователей предложила принципиально иной подход — анализировать внутреннее устройство самой языковой модели.

В своей работе на arXiv авторы рассматривают правдивость как геометрическое свойство пространства представлений языковой модели. Они выявили так называемое направление лжи в остаточном потоке данных трансформера. Для этого использовался метод Contrastive Activation Addition: активации модели на парах правдивых и ложных утверждений противопоставлялись друг другу, что позволяло вычислить вектор, разделяющий эти два класса.

На этапе проверки неизвестного утверждения его последняя активация проецируется на это направление, а затем подается в многослойный перцептрон для классификации. Важная особенность: не требуется дообучение основной модели, внешние источники информации или специализированное супервидение, кроме пар утверждений для оценки направления.

Эксперименты проводились на 11 моделях семейств Gemma, Llama и Qwen с числом параметров от 270 миллионов до 12 миллиардов. В качестве тестов использовались три популярных бенчмарка факт-чекинга: AVeriTeC, LIAR и FACTors. Результаты показали, что направление лжи практически всегда удается восстановить.

На наборах данных LIAR и FACTors новый метод сравнялся или превзошел подходы zero-shot и few-shot prompt-инжиниринга, причем наибольший выигрыш наблюдался для компактных моделей. На более сложном бенчмарке AVeriTeC производительность оказалась скромнее, что авторы связывают с особенностями разметки, требующей опоры на внешние доказательства.

Исследование подтверждает, что правдивость является структурированным линейно разделимым понятием в латентном пространстве предобученных моделей. Это открывает возможности для создания практичных инструментов обнаружения дезинформации, дополняющих традиционные методы на основе поиска информации. Исходный код проекта опубликован на GitHub.