Learn2Discern: крупные языковые модели проваливают проверку достоверности информации

В новом препринте на arXiv (2607.19355) ученые формализовали понятие «информационной разборчивости» (information discernment) для крупных языковых моделей (LLM) и представили экспериментальную платформу Learn2Discern (L2D). Работа основана на трех нормативных аксиомах, подтвержденных в ходе опроса 299 пользователей: респонденты согласились, что модели должны сильнее учитывать надежные источники (source discernment) и сильнее корректировать свои ответы, если утверждение приближает их к истине (truth discernment). Нарушение этих принципов снижает доверие к ИИ и намерение его использовать.

Бенчмарк L2D протестировали на 13 моделях (включая GPT, LLaMA, Mistral) в почти 670 тыс. заходов. Результаты оказались неутешительны: модели демонстрируют способность к различению на уровне случайного выбора как для оценки источников, так и для оценки истинности. При этом популярность источника учитывается вдвое сильнее, чем его надежность. Более того, модели почти одинаково обновляют свои представления независимо от того, улучшает ли новое утверждение их позицию относительно истины или ухудшает.

Авторы отмечают, что LLM наиболее эффективно интегрируют внешние знания на наборах данных, где их изначальные представления уже наиболее точны. Новые и более крупные модели действительно улучшают truth discernment (способность различать истинные утверждения), но не source discernment (способность оценивать надежность источника). Ученые называют это «слепым пятном», которое не устраняется простым наращиванием сложности модели.

В работе также предложены простые интервенции на этапе логического вывода (inference-time interventions), которые повышают оба типа разборчивости. Конкретные методы описаны в статье. Исследователи рассчитывают, что их бенчмарк и опрос станут основой для дальнейшей работы над ключевым свойством согласованности ИИ (alignment) — особенно актуальным по мере того, как языковые модели заменяют традиционные поисковые системы.

Набор данных L2D, а также анкета для опроса пользователей опубликованы в открытом доступе. Это позволяет другим командам проверять и улучшать способность моделей критически оценивать информацию из внешних источников.