Исследование: LLM часто ошибочно считают косвенные связи прямыми причинами

На arXiv опубликован препринт, в котором исследователи системно оценили, насколько большие языковые модели (LLM) пригодны для автоматической разметки причинно-следственных связей. В работе проверены 12 открытых моделей с инструктивной настройкой на шести эталонных графах, при пяти стратегиях подсказок и четырех источниках уверенности: вербализованная, логит-основанная, согласованность между подсказками и между моделями.

Авторы использовали языковой протокол парного сравнения. Выяснилось, что суждения LLM о причинности сильно смещены в сторону полноты: модели предсказывают слишком плотные графы, добавляя много ложноположительных рёбер. Подсказки смещают баланс между точностью и полнотой, но не решают проблему переобучения.

Ключевая проблема — различие между косвенной, прямой и обратной связью. Модели ошибочно классифицируют 40% косвенных и 36% обратных не-связей как прямые рёбра, тогда как для прочих не-связей ошибка составляет 28,2%. При этом в 80,8% и 84,6% таких ложных срабатываний вербализованная уверенность превышает 80%, что свидетельствует о завышенной самоуверенности в структурно неверных предсказаниях.

Традиционные меры уверенности показали себя плохо. Логит-основанные оценки часто стремятся к 1 независимо от правильности ответа. Согласованность между разными подсказками и между разными моделями даёт лучшую калибровку и дискриминацию, однако после поправки Холма статистическая значимость этих преимуществ не подтверждается.

Дополнительная проверка выявила потенциальную «знакомость» с бенчмарком в пяти парах модель-датасет — все они связаны с набором AsiaM. Это означает, что часть результатов может быть завышена из-за того, что модели уже встречали подобные графы в обучающих данных.

Авторы делают вывод: LLM лучше рассматривать как источник внешне проверенных мягких причинных приоров, а не как прямое доказательство причинной структуры. Это важно для задач структурного вывода, где качество начальных допущений напрямую влияет на конечный результат.