ИИ-агентов научили предсказывать сбои по трассам выполнения

ИИ-агентов научили предсказывать сбои по трассам выполнения

На arXiv опубликован препринт, в котором исследователи предлагают новый способ анализа поведения ИИ-агентов, основанных на больших языковых моделях (LLM). Метод использует конечные автоматы для прогнозирования следующего шага и предсказания ошибок.

Современные агенты выполняют многошаговые задачи, однако их поведение остаётся непрозрачным: длинные трассы выполнения сложно анализировать, что затрудняет проверку безопасности и мониторинг в реальном времени. Существующие подходы либо рассматривают отдельные трассы, либо анализируют только успешные сценарии, упуская общую структуру, которая связывает прогнозирование следующего шага и предсказание ошибок.

Авторы сжимают весь корпус трасс в один компактный конечный автомат (FSM). Этот автомат становится структурной основой для поведения агентов. На двенадцати публичных наборах данных FSM показал компактность — от 7 до 43 состояний, воспроизводил отложенные данные с точностью не ниже 0.997 и строился за миллисекунды.

Разработанный подход решил сразу две задачи. Для прогнозирования следующего шага контекст состояний FSM показал более высокую точность, чем метод Agent Workflow Memory, на всех наборах данных с совпадением истинных меток. Для прогнозирования ошибок поведенческие признаки по состояниям достигли AUROC до 0.94.

Кроме того, онлайн-монитор, основанный на предложенной модели, может ранжировать сбойные сессии выше успешных, анализируя лишь частичную трассу. Это позволяет останавливать агента задолго до завершения задачи, предотвращая потенциальные проблемы.

Авторы отмечают, что поведенческая топология агентов в значительной степени определяется средой развертывания, а не самой моделью. Это делает метод модельно-независимым и пригодным для аудита безопасности и мониторинга в реальном времени.