DCGS: новый метод защиты LLM от многошаговых атак в диалогах

DCGS: новый метод защиты LLM от многошаговых атак в диалогах

Одна из ключевых проблем безопасности больших языковых моделей (LLM) — умение отличать вредоносную атаку от безобидного, но неудачно сформулированного вопроса. Особенно сложна эта задача в многократных диалогах, где злоумышленник может постепенно раскрывать свои истинные намерения. Существующие системы безопасности обычно рассматривают каждый запрос изолированно, игнорируя историю беседы.

Группа исследователей представила новый подход — Dialogue Critic Guided Sampling (DCGS). Этот фреймворк анализирует намерения пользователя на каждом шаге диалога, используя полную историю разговора. Вместо жёстких правил безопасности DCGS обучается оценивать вероятный замысел собеседника и генерировать ответы соответственно.

С формальной точки зрения авторы моделируют диалог с атакой как марковский процесс принятия решений. Они вводят критиков (critics) на уровне отдельных токенов и полных ответов, которые оценивают кандидатные ответы с помощью функции ценности действий. Теоретически доказано, что такой подход с перевзвешиванием на этапе инференса гарантирует улучшение ожидаемой полезности для любого конечного набора вариантов.

Эксперименты проводились на наборах данных CARES-18k, WildJailbreak, Redbench и Harmbench. DCGS превзошёл сильные базовые модели и frontier-модели на задачах диалогов с атаками. Примечательно, что метод также переносится на другие модели, повышая их устойчивость без дополнительного дообучения.

Разработка открывает путь к более безопасным диалоговым агентам, способным распознавать сложные, многошаговые атаки, не ущемляя при этом добросовестных пользователей.