Исследователи обманывают атаки на open-weight модели вместо блокировки

Для открытых языковых моделей снятие защитных ограничений давно стало тривиальной операцией: метод abliteration позволяет за несколько минут убрать направление, отвечающее за отказ отвечать на опасные запросы. В новой работе на arXiv исследователи предлагают не бороться с этим напрямую, а обманывать атакующего.
Защита получила название Fool's Gold, или «обманное упрочнение». Идея в том, чтобы уступить атакующему удаление запретов, но сделать такой взлом бесполезным: после снятия ограничений большинство ответов на опасные операционные запросы становятся уверенными и правдоподобными, но содержат ложные ключевые детали. Такие «приманки» обучаются внутри дифференцируемой симуляции атаки и проявляются только в атакованном состоянии, а в обычном режиме модель сохраняет исходное поведение.
Авторы протестировали защиту на семи моделях из пяти семейств — от 9 до 122 миллиардов параметров, включая плотные и mixture-of-experts архитектуры. Шесть моделей прошли заранее заданный порог эффективности: доля ответов-обманок на отложенных запросах в атакованном состоянии составила от 0,51 до 0,90, прирост за счёт защиты — от 0,27 до 0,84. При этом у всех шести моделей показатели обычного полезного поведения не вышли за допустимые рамки. Седьмая, более маленькая модель, не дотянула до порога — это пограничный случай.
Отдельно проверялась устойчивость защиты на замороженных тестовых выборках и нетронутых слоях данных — результаты воспроизвелись. Исследователи также подчёркивают эпистемический аспект: без независимого источника истины невозможно отличить поддельные ответы от правильных. В тестах на срезе CBRNE-задач из внешних бенчмарков защищённая 122-миллиардная модель дала фатально ошибочные ответы в 0,82–0,86 случаев среди ответов сопоставимого качества, тогда как незащищённая — не более 0,10.
Повторная выборка не восстанавливает уверенности: при консенсусе по элементам на K=64 полную работоспособную процедуру удалось собрать только на 0,083–0,625 запросов, где инструмент валидируется, против 0,58–0,96 у незащищённой модели. При этом без разметки невозможно определить, с каким из режимов имеешь дело. Для самой слабой модели из шести утверждение справедливо только на уровне отдельных выборок.
Авторы отмечают, что защита не касается джейлбрейков в диалоговом режиме и действует только на изначально выпущенную защищённую версию весов. Работа носит исследовательский характер и доступна на arXiv под номером 2608.17202.






