ИИ пока уступает людям в написании научных обзоров: представлена LitReview Arena

Научные обзоры — важный элемент исследовательской работы, но оценить автоматически сгенерированные обзоры непросто: качество зависит от экспертного суждения, а не от количества совпадений с источниками. Для решения этой задачи представлена платформа LitReview Arena, работающая по принципу «битв» между системами и людьми.
Авторы разработали структурированный протокол: эксперты в предметной области, имеющие опыт написания научных статей с использованием ИИ, сравнивают анонимизированные черновики. Каждый эксперт оценивает обзоры по пяти критериям, специфичным для научных обзоров: структура, синтез, полнота, ясность и практическая ценность. В рамках эксперимента собрано около трёх тысяч экспертных оценок.
Результаты показали, что даже самые сильные современные системы выигрывают лишь 23% решающих матчей у человеческих черновиков по общей полезности. При этом агентные ИИ-модели, например Sonar Deep Research, существенно опережают базовые языковые модели: разница в эффективности превышает 60%.
Отдельно исследователи проверили, насколько существующие методы автоматической оценки на основе LLM совпадают с мнением людей. Согласованность оказалась невысокой: коэффициент ранговой корреляции Спирмена составил всего 0,467. Особенно сильные расхождения наблюдались по критериям, требующим синтеза, — структуре работы и предложениям по дальнейшим исследованиям.
На основе собранных предпочтений создан калиброванный оцениватель LitJudge. Он значительно лучше согласуется с экспертами: корреляция выросла до 0,78, что сопоставимо с уровнем согласия между самими экспертами.
Код и данные проекта опубликованы в открытом доступе на GitHub. Разработка может быть полезна для создания более надёжных инструментов автоматической оценки научных обзоров и повышения качества ИИ-систем, используемых в исследовательской работе.







