WebGrader: новый метод обучения ИИ созданию сайтов повысил успешность до 52%

В новой научной работе представлен WebGrader — самообучающийся программный оценщик, который помогает большим языковым моделям генерировать рабочие сайты по текстовому описанию. Метод решает проблему формирования наград в обучении с подкреплением.

Авторы отмечают, что стандартные подходы требуют рукописных браузерных сценариев, которые дорого создавать, либо используют мультимодальные модели, способные вынести вердикт до наступления ключевого состояния. WebGrader автоматически выводит последовательности действий из запроса и превращает их в исполняемые Flow Contracts.

Система запускает сгенерированный проект в реальном браузере, сверяет целевые действия с исходным кодом и DOM, а также собирает визуальные данные, ответы и изменения состояния по ходу выполнения. Это позволяет выдавать оценку Pass только после фактического наблюдения за переходом.

В обучении используется офлайн-цикл, который находит переиспользуемые навыки проверки, тестирует их на отдельных страницах и закрепляет лучшие варианты до начала обучения политики. Такой подход разделяет планирование тестов, привязку действий, сбор доказательств и семантическую оценку.

На бенчмарке WebGen-Bench модель с 8 млрд параметров, обученная с WebGrader, достигла функциональной успешности 52,01%. Это на 7,88 пункта лучше, чем у метода, сочетающего внешний вид и скриптовое вознаграждение, и превосходит результаты o4-mini и DeepSeek-v4-flash.

На внутреннем тесте WG-core-250 политика получила полный балл 44,953 и обошла Qwen3-Coder-480B. По мнению исследователей, подобные саморазвивающиеся оценщики могут ускорить развитие автоматической веб-разработки и снизить затраты на ручную проверку.