Новый метод WMRL ускорил обучение ИИ-исследователей в 3-4 раза

Автоматизация эмпирических исследований давно остается одной из целей искусственного интеллекта. Современные большие языковые модели уже способны самостоятельно реализовывать решения и учиться на результатах своего выполнения. Однако, как показано в новом препринте на arXiv, при масштабировании таких агентов возникает фундаментальная проблема: генерация и исполнение траекторий растут неравномерно.

Генерация использует общие вычислительные ресурсы через батчинг, а каждое исполнение требует отдельной песочницы и реального машинного времени. В результате именно исполнение становится узким местом и доминирует в стоимости обучения. Исследователи из проекта предлагают решение под названием World Model RL (WMRL), которое заменяет реальное исполнение окружения мировой моделью.

Мировая модель, как отмечают авторы, может быть несовершенной: ее награды содержат смещение и шум. Для компенсации этих недостатков разработаны два механизма — онлайн-дебиасинг и подавление шума на основе обратной дисперсии. Первый корректирует смещение, второй уменьшает шум. Теоретический анализ доказывает, что оба механизма строго улучшают гарантии сходимости.

Эксперименты подтвердили эффективность подхода: WMRL ускоряет обучение в 3–4 раза на различных задачах и при разных масштабах агентов, при этом превосходя стандартные базовые алгоритмы RL. Особенно впечатляет результат на открытых моделях: пост-обученные агенты с 4B и 9B параметров обошли более крупные открытые модели с 48B и 120B параметров на удерживаемых тестах.

Метод оказался универсальным — его перенесли на пост-обучение воплощенных VLA-политик (vision-language-action). Это демонстрирует, что WMRL может применяться не только в автоматических исследованиях, но и в робототехнике и других областях, где важно обучать агентов в симуляции.

По словам авторов, устранение узкого места исполнения позволяет масштабировать обучение исследовательских агентов с меньшими затратами. Это шаг к более практичным системам автономного научного поиска, хотя до полной автоматизации экспериментов еще далеко.