Новый протокол Adversarial Review для ИИ-агентов повышает точность проверки кода

Международная группа исследователей представила на arXiv новый подход к проверке кода с помощью мультиагентных LLM-систем. Протокол получил название Adversarial Review (состязательное ревью).
Ранние мультиагентные системы распределяли роли между большим числом моделей, однако увеличение числа агентов давало всё меньший прирост на задачах уровня репозитория. Альтернативный подход — использовать агентов как пассивные инструменты — устраняет преимущества взаимодействия.
Разработчики предложили компромисс: минимальная кооперация трёх агентов — основного разработчика, рецензента и критика. Рецензент оценивает код, а критик проверяет само ревью через структурированное разногласие. Это позволяет избежать ложного консенсуса, когда агенты соглашаются без достаточных оснований.
На тесте LiveCodeBench протокол AR показал наивысший процент успешных решений среди протестированных методов, обойдя базовую систему с пятью агентами, при этом используя только три.
На бенчмарке SWE-PRBench исходная версия AR выявила проблему ложного консенсуса, при которой агенты сходились во мнении без достаточных доказательств. После добавления явного требования разногласий в одном сообщении метод достиг максимального показателя F1 среди испытанных конфигураций.
На SWE-bench Verified подход также продемонстрировал улучшение по сравнению с базовыми методами на задачах уровня репозитория.
По мнению авторов, работа показывает, что эффективное коллективное ревью кода не требует большого числа агентов или сложных схем коммуникации. Ключевое — минимальное, структурированное и подкреплённое доказательствами разногласие.







