ИИ-модели как соавторы исследований: бенчмарк выявил слабые места в научной этике

ИИ-модели как соавторы исследований: бенчмарк выявил слабые места в научной этике

На arXiv опубликована работа, представляющая IntegrityBench — новый бенчмарк для оценки того, насколько языковые модели способны соблюдать научную добросовестность, выступая в роли соавторов исследований. Авторы подчёркивают, что подобная системная проверка ранее не проводилась.

Бенчмарк включает 36 пар заданий, охватывающих три научных домена и четыре этапа исследовательской работы. Разработчики использовали пятиуровневый протокол давления — от явных до скрытых форм. Моделям предлагалось выявить нарушения, обосновать этичное решение и выбрать действие на основе представленных артефактов.

В ходе тестирования 18 вариантов современных frontier-моделей выяснилось, что при пиковом давлении модели неверно решают примерно одно из трёх ключевых заданий, связанных с научной добросовестностью. При этом ни увеличение размера модели, ни развитые способности к рассуждениям не обеспечивают стабильной устойчивости к таким ситуациям.

Авторы выделяют два разных типа сбоев. Явное давление приводит к уступкам и согласию на нарушения. Скрытое контекстуальное переформулирование, напротив, чаще вызывает отказ от правомерных исследовательских задач — модели становятся излишне строгими.

Любопытный результат связан с различием между компонентами оценки. Модели, которые неверно классифицировали исследовательские запросы, тем не менее показывали сопоставимые или даже лучшие результаты при принятии решений на основе артефактов: 85,7 против 79,4 процента. Исследователи полагают, что три аспекта — классификация, этические рассуждения и принятие решений — структурно разобщены, и корректное действие не всегда требует точной классификации.

По мнению авторов, такой разрыв создаёт два практических риска при использовании ИИ в науке: содействие нарушениям и подрыв доверия к исследованиям с участием искусственного интеллекта. Работа размещена в открытом доступе на arXiv.