GhostWriter: хакеры научились внедрять ложные воспоминания в ИИ-агентов — эффективность до 98%

GhostWriter: хакеры научились внедрять ложные воспоминания в ИИ-агентов — эффективность до 98%

Команда исследователей из Университета штата Нью-Мексико разработала атаку GhostWriter, нацеленную на долгосрочную память ИИ-агентов. Вместо взлома языковой модели злоумышленники внедряют ложные сведения в сохранённые системой данные, что позволяет влиять на решения ассистента спустя недели или месяцы.

Современные ИИ-агенты всё чаще получают постоянную память: они запоминают стиль письма пользователя, рабочие задачи, контакты и контекст разговоров. Это делает их удобными, но открывает новый канал для атаки — сохранённые данные становятся частью системы принятия решений.

GhostWriter работает в два этапа. Сначала злоумышленник отправляет обычное письмо, приглашение в календарь или другой внешний контент со скрытыми инструкциями. Если агент автоматически анализирует такие данные и сохраняет их в память, вредоносная информация остаётся в спящем режиме. Позже при обычном запросе агент извлекает отравленную запись и может выполнить действия, выгодные атакующему.

Эксперименты показали серьёзность проблемы: успешность внедрения вредоносной памяти составила около 98%, а вероятность её активации при последующих запросах — порядка 60%. Атака может использоваться для подмены информации, утечки конфиденциальных данных, скрытой передачи файлов или выполнения действий за пределами разрешённых полномочий.

Авторы исследования предложили защитную архитектуру Agentic Memory Sentry (AM-Sentry). Она проверяет данные перед сохранением в память и анализирует извлекаемые воспоминания перед передачей их языковой модели. В наиболее строгой конфигурации AM-Sentry снизила эффективность GhostWriter до менее чем 12%, при этом почти не повлияв на полезные функции ИИ-агента.

Исследователи отмечают, что традиционные методы защиты от промпт-инъекций не подходят против атак на память: вредоносные записи могут выглядеть как обычная информация, а не как явные команды. По мере того как ИИ-агенты начинают управлять электронной почтой, календарями, кодом и бизнес-процессами, безопасность их памяти становится отдельным критическим приоритетом.

Работа показывает, что следующий этап борьбы за безопасность ИИ будет связан не только с контролем того, что модели генерируют, но и с контролем того, что они запоминают. Долгосрочная память может сделать ассистентов значительно полезнее, но без механизмов проверки она превращается в один из самых опасных элементов их архитектуры.