Предодобренные аналитические программы обошли динамические ИИ-агенты в тесте arXiv
На сервере препринтов arXiv появилось исследование, посвященное управляемому подходу к корпоративной аналитике. Авторы предложили гибридную схему: языковая модель интерпретирует вопрос пользователя, а детерминированная политика выбирает и запускает заранее одобренную аналитическую программу. Такая программа возвращает не только результат, но и доказательства его корректности.
В основе работы лежит ограничение выразительности системы. Как отмечают авторы, в рамках заданного аналитического класса она сохраняет достаточную гибкость благодаря использованию реляционных операций, агрегации, сравнений, оконных функций, ранжирования и поиска подобия. Это позволяет обрабатывать типовые запросы, не перекладывая на модель принятие критических решений.
Один из ключевых выводов исследования — воспроизводимость результатов. Фиксированные значения, правила политики, данные и порядок выполнения делают каждый запуск повторяемым. Это свойство особенно важно для предприятий, где аудит и проверка аналитических выкладок обязательны.
Эксперимент включал 440 запусков. В трех моделях размером 8 миллиардов параметров использовались разные роли: часть моделей генерировала SQL и выбирала инструменты во время выполнения, а модель Qwen3-8B только интерпретировала намерение пользователя, тогда как утвержденную программу выполняла политика.
Результаты оказались резко контрастными. Ни один из 330 эпизодов с планированием на лету не смог полностью соответствовать контракту ответ-и-доказательство на всех тестовых наборах данных. В то же время система с политикой, исполнявшей одобренную программу, успешно справилась со всеми 110 запусками.
Исследователи подчеркивают, что это конфигурационно-специфичный результат. Он не говорит о том, что динамические агенты в принципе не способны на успех при других архитектурах и условиях. Однако в рамках протестированных настроек более жесткий контроль над выполнением отчетливо повышает надежность.
Работа затрагивает актуальную дискуссию о границах применения больших языковых моделей в бизнес-задачах. Судя по данным эксперимента, комбинирование интерпретации от ИИ с детерминированными инструментами может быть более предсказуемым, чем предоставление модели полной свободы действий.


