ИИ-учёные: новая система оценки показывает двукратное превосходство коммерческой FARS

Насколько хороши научные статьи, написанные искусственным интеллектом? Ответить на этот вопрос попыталась группа исследователей, представившая на arXiv препринт с описанием нового бенчмарка для систем автономного научного творчества.

Авторы разработали автоматизированную систему рецензирования на базе frontier-моделей, которая оценивает работы по четырём критериям: оригинальность, научная строгость, ясность и значимость. Это первый количественный бенчмарк для таких систем.

В тесте участвовали четыре известные платформы: Sakana AI (версии v1 и v2), CycleResearcher и Data-to-Paper. Каждая система генерировала статьи по одному и тому же набору из 15 исследовательских предложений, созданных коммерческой компанией FARS. Всего было получено 60 статей, к которым добавили 15 эталонных работ от FARS.

Оценку выполняли три независимых больших языковых модели: GPT-5.4, Gemini и Claude. Результаты показали, что статьи FARS получили средние баллы 2,14–2,47 по пятибалльной шкале, тогда как остальные системы — лишь 1,00–1,87. В оценках Gemini и Claude отрыв FARS от ближайшего конкурента превысил двукратный.

Наблюдается высокая согласованность между оценками Gemini и Claude: коэффициент корреляции Спирмена составил 0,907. Обе модели также очень тесно связаны с итоговым синтетическим баллом (корреляция 0,961). Это говорит о надёжности автоматического рецензирования.

Вместе с тем GPT-5.4 показал заметно более слабую согласованность с другими оценками — корреляция лишь около 0,32. Авторы предполагают, что эта модель использует иные критерии при анализе научных текстов.

Разработчики считают, что мультимодельная оценка может стать масштабируемым и стабильным инструментом для сравнения качества автономных исследовательских систем. Это особенно важно по мере того, как ИИ-учёные начинают играть всё большую роль в ускорении научных открытий.