Мультиагентная система Dude повысила точность проверки научных статей на соответствие коду

С ростом числа научных публикаций ручная проверка соответствия статей и прилагаемого кода становится всё менее реалистичной. В ответ на это исследователи всё чаще обращаются к большим языковым моделям, но существующие однопроцессорные подходы сталкиваются с нехваткой контекста и односторонним анализом, что снижает полноту поиска расхождений.

В новой работе на arXiv представлена система Dude, позиционируемая как первая мультиагентная система с двойным детектированием для поиска расхождений между бумагой и кодом. По замыслу авторов, несколько ИИ-агентов должны совместно анализировать текст статьи и программный код, однако при создании такого подхода выявилась проблема асимметрии гранулярности.

Язык статьи описывает идеи и алгоритмы обобщённо, в то время как код содержит конкретные детали реализации. Это приводит к двум крайностям: агенты либо чрезмерно интерпретируют описание, либо сообщают о несуществующих расхождениях, увеличивая долю ложных срабатываний.

Для решения этой проблемы авторы внедрили два механизма: согласование гранулярности и двухэтапную фильтрацию значимости. Эти механизмы предотвращают ложные отчёты агентов и повышают надёжность обнаружения.

В экспериментах на реальных наборах данных Dude показал улучшение полноты и точности по сравнению с базовыми методами до 22,8%, а F1-мера выросла на величину до 18,7%.

Разработка может быть полезна как для самих авторов статей, позволяя заранее находить несоответствия, так и для рецензентов и читателей, которые хотят убедиться в корректности опубликованных результатов.