Обвязка NVIDIA AVO подняла результат LLM на тесте ARC-AGI-3 до 100%

Обвязка NVIDIA AVO подняла результат LLM на тесте ARC-AGI-3 до 100%

NVIDIA опубликовала в своём блоге материал о разработке под названием AVO (Agentic Variation Operators). Судя по публикации, это обвязка, которая улучшает работу уже существующих больших языковых моделей, позволяя им полнее использовать свой потенциал.

Изначально AVO создавалась для внутренних задач компании — улучшения архитектуры собственных GPU. По словам авторов, в этом направлении инструмент также показал хорошие результаты. Однако затем было решено опробовать его на одной из самых сложных задач для LLM — тесте ARC-AGI-3.

ARC-AGI-3 специально устроен так, чтобы задания в нём были посильны обычному человеку, но вызывали трудности у языковых моделей. В публикации отмечается, что не менее 20% людей решают все 100% задач с первой попытки. До этого момента модель Claude Opus 5, с которой экспериментировали авторы, справлялась примерно с 30% заданий.

С подключением AVO результат скакнул до 100%. Авторы подчёркивают, что обвязка может работать и с другими моделями, например, они экспериментировали с GPT-5.6 Sol.

Как следует из описания, AVO выступает для модели в роли направляющего агента. Она помогает осуществлять стратегическое планирование, решает проблему зацикливания LLM, а также меняет план поиска решения, если предложенный ранее не сработал.

Похоже, подход NVIDIA открывает путь к значительному улучшению работы уже существующих моделей без их радикальной перестройки. Это позволяет задействовать скрытые возможности текущих архитектур и может иметь широкие практические применения в IT-индустрии.