OpenEvoShield: новая защита мультиагентных систем на LLM от динамических атак

Мультиагентные системы на основе больших языковых моделей (LLM-MAS) всё чаще применяются в критически важных сферах. Однако уязвимость к вредоносным инструкциям, которые злоумышленники внедряют через межагентное взаимодействие, остаётся серьёзной проблемой. Атаки на такие системы могут распространять опасное поведение между агентами, а сами угрозы постоянно эволюционируют.

Традиционные методы защиты обычно предполагают статическую среду и быстро теряют эффективность при изменении распределения данных — как со стороны атак, так и из-за естественной смены поведения легитимных агентов. Исследователи предложили OpenEvoShield — совместный эволюционный фреймворк непрерывной обороны.

OpenEvoShield состоит из четырёх ключевых компонентов. Асимметричный контроллер скорости (M1) разделяет темпы обучения для быстрых атак и медленных нормальных изменений. Модуль обновления нормальных границ (M2) поддерживает динамическую поведенческую границу. Ансамбль политик с регуляризацией EWC (M3) быстро адаптируется без катастрофического забывания. Энергетический детектор (M4) объединяет информацию на уровне узлов, подграфов и графов для обнаружения новых типов атак как out-of-distribution.

Эксперименты охватили 100 раундов развёртывания на пяти наборах данных и четырёх топологиях мультиагентных систем. Результаты показали, что OpenEvoShield превосходит как статические, так и непрерывно обучаемые базовые методы. Фреймворк способен обнаруживать большинство ранее не встречавшихся атак, сохраняя низкий уровень ложных срабатываний.

Разработка открывает путь к созданию более безопасных мультиагентных систем, способных работать в реальных условиях, где угрозы постоянно меняются, а поведение системы дрейфует. Это особенно важно для приложений в автономном вождении, финансах и других областях, где требуется высокая надёжность.