Новая защита от семантических атак на ИИ-модели: метод LIV обнаруживает скрытые вредоносные запросы

Безопасность больших языковых моделей (LLM) часто оказывается поверхностной: механизмы отказа активируются только на финальных стадиях генерации, но не стирают знания о вредоносных концепциях, заложенные в процессе предобучения. Это делает модели уязвимыми к так называемой семантической маскировке — атакам, которые оборачивают опасное намерение в безобидный повествовательный контекст, например, в творческое задание, обходя стандартные фильтры ввода и вывода.

\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\n

В новом препринте на arXiv исследователи проанализировали активации нейронных сетей трёх семейств малых языковых моделей (Phi-3, Qwen2.5 и Gemma-2b) в условиях подобных атак. Они обнаружили универсальный «горизонт намерения» — критическую глубину, обычно 15–20% от общего числа слоёв, на которой модель теряет явное представление вредоносного замысла, адаптируя запрос под «безопасный» нарратив.

\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\n

Результаты показали, что на поздних слоях замаскированные атаки математически неотличимы от безопасных запросов — вероятность детектирования не превышает 20%. Однако на ранних слоях сохраняется отдельная «сигнатура вреда», которую можно использовать для выявления угрозы.

\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\n

На основе этого наблюдения авторы предложили защитный механизм Latent Intent Verification (LIV) — лёгкий зондирующий метод, который анализирует внутренние представления модели на ранних слоях. В экспериментах на наборе данных PKU-SafeRLHF LIV продемонстрировал улучшение точности обнаружения на 20–50% по сравнению со стандартными защитными средствами на всех протестированных архитектурах.

\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\n

Особенно важно, что метод способен нейтрализовать zero-day семантические атаки, то есть новые, ранее неизвестные варианты обхода, без необходимости переобучения модели. Это делает LIV практичным решением для усиления безопасности языковых моделей в реальных сценариях, где появление новых угроз опережает обновление защитных систем.

\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\\n

Работа подчёркивает, что для надёжной защиты важно учитывать не только выходные фильтры, но и внутреннюю динамику обработки запросов. Исследование опубликовано в виде препринта и может быть использовано разработчиками ИИ-систем для повышения устойчивости к атакам, нацеленным на обход ограничений.