Reasoning Jury: жюри открытых LLM эффективнее топ-моделей в оценке рассуждений

Оценка качества рассуждений больших языковых моделей остается сложной задачей. Чтобы улучшать такие ИИ через обучение с подкреплением и отбор данных, нужно точно определять ошибки в длинных логических цепочках, но даже самые продвинутые модели-судьи часто пропускают дефекты.
Авторы новой работы, опубликованной на arXiv, предлагают заменить одного судью на целое жюри. Идея в том, что несколько LLM могут критиковать решения друг друга и менять свои первоначальные оценки под руководством модератора. Это позволяет выявлять не только факт ошибки, но и ее серьезность.
Эксперименты показали, что жюри, собранное из открытых моделей, в частности gpt-oss-120b, заметно точнее справляется с поиском дефектов рассуждений, чем одиночные фронтирные модели: opus-4.6, sonnet-4.6 и gemini-3.1-pro. Такой подход особенно актуален, потому что использование фронтирных моделей в онлайн-обучении часто ограничено правилами сервисов.
Помимо точности, важна и экономическая сторона. Согласно аннотации, совокупная стоимость работы жюри — включая первоначальные вердикты, обсуждения и подведение итогов — составляет лишь 8–15% от затрат на запуск фронтирных LLM в роли судьи.
Кроме того, коллективные оценки помогают глубже понять типичные слабые места моделей при выполнении бенчмарков. Это дает возможность точнее настраивать ИИ и улучшать его производительность в реальном времени.
Разработка демонстрирует, что небольшие открытые модели могут эффективно заменять дорогие закрытые системы в задачах оценки, что открывает путь к более доступному контролю качества ИИ.




