Ученые выявили новую уязвимость языковых моделей: неполные запросы обходят защиту

Крупные языковые модели (LLM) всё чаще выпускаются с открытыми весами и встроенными механизмами защиты от вредоносных запросов. Однако, как показало новое исследование, такие системы остаются уязвимыми перед частично сформулированными опасными запросами.

Группа учёных представила на arXiv препринт, в котором формализовала и систематически изучила феномен incomplete prompt jailbreaks (IPJ) — когда неполный, но вредоносный запрос побуждает модель дать опасное продолжение. В отличие от классических джейлбрейков, здесь пользователь может не дописывать явную угрозу, но модель сама завершает нежелательный ответ.

Эксперименты показали, что модели склонны откладывать отказ до самого конца предложения. Это означает, что если пользователь вводит, например, неполное вредоносное утверждение, модель может его продолжить без должного отклонения. Авторы протестировали различные типы неполных фраз (так называемые аттракторы) и выявили, что отказ часто наступает слишком поздно.

Традиционные методы усиления безопасности через дообучение (fine-tuning) на отказ от неполных запросов оказались неэффективны: защита не обобщается на другие тематические области и типы аттракторов. Это затрудняет создание универсального фильтра.

В поисках более точного контроля исследователи идентифицировали два класса функциональных нейронов: нейроны завершения, отвечающие за отказ, и нейроны продолжения, способствующие завершению. Вмешательство на уровне отдельных нейронов, как утверждается, может обеспечить более гибкую и надёжную защиту.

Работа подчёркивает необходимость тонкой настройки безопасности в открытых моделях и предлагает новый подход к противодействию атакам. Если нейронные интервенции покажут эффективность на практике, это может стать важным шагом в повышении безопасности крупных языковых моделей без ущерба для их функциональности.