Мультимодальные ИИ-модели: обзор arXiv выявил новые угрозы безопасности
Исследователи представили обзор, посвященный безопасности мультимодальных больших языковых моделей (MLLM). Такие системы объединяют текст, изображения, звук и другие типы данных, что расширяет их возможности, но одновременно создает новые уязвимости.
В отличие от одномодальных моделей, мультимодальные архитектуры полагаются на согласование и интеграцию различных типов данных. Именно это, по мнению авторов, меняет ландшафт угроз: злоумышленники могут атаковать не отдельные компоненты, а механизмы их взаимодействия.
Авторы выделяют несколько категорий рисков, включая нарушение целостности модальностей, их рассогласование и комбинированные угрозы. В обзоре рассмотрены четыре класса атак: состязательные воздействия, отравление данных, джейлбрейки и галлюцинации.
Отдельное внимание уделено тому, как меняются требования к системам защиты. Традиционные методы, созданные для одномодальных моделей, часто не подходят для мультимодальных систем, поскольку не учитывают сложные перекрестные взаимодействия.
Авторы систематизировали последние достижения в области безопасности MLLM и предложили таксономию угроз. Это должно помочь разработчикам выстраивать более надежные и масштабируемые механизмы защиты.
В заключении обозначены открытые проблемы и перспективные направления исследований. По мнению авторов, дальнейшая работа должна быть направлена на создание принципиально новых подходов к безопасности, учитывающих специфику мультимодальных архитектур.


