ИИ-ученый для навигации роботов: новая система не дрейфует и проверяет гипотезы

Автономные исследовательские циклы на основе больших языковых моделей обещают ускорить машинное обучение, но часто скатываются к локальным улучшениям метрики, игнорируя исходные гипотезы. Новая работа на arXiv представляет AI Scientist, который решает эту проблему структурно.
Система построена на парадигме автоисследований Карпаты и изучает обобщение в навигации четвероногих роботов в симуляции. Ключевое нововведение — неизменяемая карточка эксперимента, которая связывает предсказание каждой итерации с результатом по фиксированной схеме. Это не позволяет «переписывать» опровергнутые гипотезы задним числом.
Второй компонент — специализированные субагенты с ограниченными механическими ролями. Они не принимают субъективных решений, а лишь выполняют строго определённые функции. Третий элемент — kkanbu, предпочтительный оракул, который хранит исследовательский вкус пользователя в виде типизированного графа знаний. Только ему разрешено выносить субъективные суждения.
Чтобы проверить влияние оракула, авторы запустили одинаковый цикл дважды — с kkanbu и без него — в одиннадцати исследовательских потоках. Обе ветви не дрейфовали: примерно три четверти собственных гипотез были опровергнуты. Лучшая обученная политика была получена в ветви без оракула.
Разница проявилась в направлении, а не в оценке. Именно ветвь с оракулом исследовала адаптацию во время теста, создала выигрышные дизайны и перенесла уроки между потоками, которые другая ветвь многократно переоткрывала. Каркас сохраняет честность цикла, а kkanbu решает, куда смотреть.
По словам авторов, такой подход демонстрирует, что разделение структурной честности и субъективного вкуса позволяет автономным системам не только избегать дрейфа, но и выбирать осмысленные направления исследований. Работа доступна на arXiv под номером 2608.07542.







