Почти 97% сцен в автобиографии, написанной ИИ, не подтвердились фактами
Научная работа, опубликованная на arXiv, представила первый количественный аудит автобиографии, сгенерированной большой языковой моделью (LLM). Автор исследования выступила одновременно и объектом проверки: она вела 366-дневный дневник в формате «страница в день», который заполняла с помощью диалогового ИИ. Входными данными для модели служили шаблон, два примера дней и ежедневная цитата — но не личный корпус автора.
После написания каждый день был проверен на уровне отдельных сцен по независимому верификационному корпусу с использованием четырехуровневой рубрики, зафиксированной до начала анализа. Результат: 354 из 366 дней (96,7%) не получили оценку VERIFIED, то есть не было найдено положительных подтверждений описанных сцен. Только 12 дней содержали хотя бы одну подтвержденную сцену, а 19 дней (5,2%) содержали утверждения, прямо противоречащие документальным записям.
Основным типом ошибки оказался «обоснованный дрейф» (grounded drift): реальные люди, работодатели и локации попадали в вымышленные сцены. Впрочем, доля этого типа ошибок варьировалась в зависимости от оценщика. Повторная независимая проверка подтвердила исходный показатель — оснований считать первоначальную цифру завышенной нет. Однако надежность четырехчастной таксономии оказалась лишь умеренной.
Исследователи также проверили, как с задачей справляются современные именные модели. При тех же входных данных повторная генерация тех же дней привела к 100% неподтвержденных сцен. Если же в генерацию включался корпус самого автора, доля неподтвержденных дней снижалась до 83,3% — заметное улучшение, но все еще высокий уровень недостоверности.
Автор работы подчеркивает, что создала измерительный инструмент, который можно использовать для аудита. При этом граница между слабой и неподтвержденной сценой в рубрике показала себя ненадежной. Этот факт стоит учитывать при разработке систем проверки фактов в автобиографических и мемуарных текстах, генерируемых ИИ.
Результаты поднимают важный вопрос о доверии к нейросетевым текстам, претендующим на описание реальных событий. Даже при минимальном вмешательстве человека модель склонна к созданию правдоподобных, но не соответствующих действительности деталей. Пока что включение личных данных автора в промпт остается лишь частичным решением.





