NEXUS: новый ИИ-монитор безопасности для LLM-агентов с инструментами — точность до 94,9%

Группа исследователей разработала NEXUS (Neural EXecution Utility and Safety) — структурированный монитор безопасности для LLM-агентов, которые выполняют действия с помощью внешних инструментов. Система предназначена для оперативного контроля в runtime и выбора одного из четырёх вариантов вмешательства: разрешить, заблокировать, запросить подтверждение или запросить исправление.

NEXUS объединяет детерминированные правила безопасности, проверку аргументов на уровне отдельных параметров и калиброванный логистический регрессионный риск-скоринг для постепенного повышения уровня реагирования. Такой подход позволяет точнее оценивать опасность действий агента и адаптивно повышать строгость контроля.

На синтетическом бенчмарке из 128 примеров NEXUS показал F1 0,949 и 4-классовую точность вмешательства 0,6406, что на 27,3 процентных пункта лучше, чем при использовании только правил. На тесте R-Judge F1 составил 0,861 (против 0,849 у правил), на AgentHarm показатели совпали из-за ограниченности угроз, а на IPI система достигла 0% успешных атак при 99% разрешённых управляющих действий.

Особую сложность для маршрутизации вмешательств представляет слепой к правилам бенчмарк NEXUS-Stress — там F1 достиг 0,881. Тем не менее, задержка системы составляет всего 0,205 мс, что добавляет менее 0,1% накладных расходов к типичному циклу работы агента.

Разработчики опубликовали код, бенчмарки и калиброванный риск-скоринг в открытом доступе. Это позволяет другим командам интегрировать NEXUS в свои системы и дорабатывать под конкретные сценарии.

Появление таких инструментов, как NEXUS, — важный шаг в повышении безопасности автономных LLM-агентов, особенно в чувствительных областях вроде финансов, здравоохранения или управления инфраструктурой, где ошибка может дорого обойтись.