PlanFlip: новая угроза для многоагентных ИИ-систем
Группа исследователей опубликовала на arXiv препринт, в котором представила PlanFlip — набор атак на многоагентные системы на основе больших языковых моделей (LLM). Целью атак выбрана фаза планирования, где специальный агент-планировщик разбивает общую задачу на подзадачи для других агентов-исполнителей.
PlanFlip включает четыре типа атак: подмена цели (GoalSubstitution), инверсия приоритетов (PriorityInversion), загрязнение контекста (ContextPollution) и путаница ролей (RoleConfusion). Все они маскируются под правдоподобный вывод инструментов, чтобы обойти keyword-фильтры.
Авторы протестировали PlanFlip на девяти передовых LLM в 3479 эпизодах. Выяснилось, что более мощные модели демонстрируют более высокий уровень уязвимости: GPT-5 показал пиковую частоту успешных атак (ASR = 0,68), что опровергает распространенное мнение о большей безопасности сильных моделей.
Также обнаружена слепая зона в однородных пайплайнах, где все агенты используют одну и ту же базовую модель. Например, в системе на GPT-4o и Llama-3.3-70B атаки полностью перестраивали план, но критик на том же бэкбоне сообщал об отсутствии отклонений. Два независимых оценщика зафиксировали лишь незначительное семантическое отклонение в планах (-0,20…-0,32), а корреляция оценок составила 0,943.
В то же время модели с усиленным рассуждением (reasoning-augmented) показали полную устойчивость: DeepSeek-R1 не изменил ни одного плана (StepShift = 0,00) во всех атаках.
Для противодействия PlanFlip предложены методы GoalAnchorCheck и CrossAgentConsensus, которые достигают уровня обнаружения атак до 1,00 и превосходят базовые защиты в 15 из 16 тестовых ячеек.
Главный вывод работы: для защиты многоагентных ИИ-систем необходимо разнообразие моделей (гетерогенность), так как дублирование однотипных бэкбонов не обеспечивает безопасности от атак на фазу планирования.


