Новая защита DiSCO снижает долю опасного контента в text-to-image моделях на 37,7%

Научная работа, опубликованная на arXiv, описывает новый метод защиты text-to-image моделей от генерации нежелательного контента, включая сцены насилия и наготы. Разработка получила название DiSCO (Distribution-guided Contrastive Prompt Optimization) и представляет собой полностью чёрно-ящичный подход, работающий на уровне текстового запроса.

Проблема безопасности генеративных моделей становится всё более острой: даже нейтральные на вид промпты могут приводить к созданию изображений, нарушающих правила контентной политики. Особенно опасны адверсариальные атаки, когда вредоносный запрос маскируется под безобидный текст.

Существующие методы защиты в основном требуют белого доступа к модели — изменения весов, оптимизации текстового энкодера или вмешательства в процесс инференса. Это делает их неприменимыми к закрытым коммерческим системам, где внутренняя архитектура недоступна.

Альтернативные чёрно-ящичные подходы, использующие языковые модели для переписывания промптов, тоже не лишены недостатков. Авторы выделяют особый класс проблем, названный ими безвредным адверсариальным сценарием: запрос может быть лингвистически безопасным, но всё равно провоцировать нежелательную генерацию из-за особенностей распределения обучающих данных.

DiSCO обходит эти ограничения. Метод работает как подключаемый модуль на стороне промпта: он расширяет суффикс запроса с помощью beam search и оптимизирует его через контрастный подсчёт баллов на основе наборов безопасных и небезопасных изображений, сгенерированных самой целевой моделью. Процесс повторяется итеративно, пока не будет получен безопасный результат.

Эксперименты на бенчмарке I2P показали, что DiSCO снижает показатель успешности атаки (ASR) на 37,7% для незащищённых моделей и на 25,13% для уже защищённых систем, работающих под несколькими красными командными атаками. При этом сохраняется семантическая точность запроса и улучшается когерентность изображений.

Так как DiSCO не зависит от архитектуры модели и работает только с текстовым входом, его можно применять к любым системам генерации изображений, включая проприетарные сервисы, без необходимости менять саму модель. Это делает метод практичным инструментом для повышения безопасности генеративного ИИ.