TRACE: учёные нашли способ вернуть безопасность LLM после кастомного обучения

Платформы Fine-Tuning-as-a-Service (FTaaS) позволяют пользователям дообучать большие языковые модели (LLM) под свои задачи, но при этом могут ослаблять встроенные механизмы безопасности. Разработчикам приходится восстанавливать защиту модели без повторного полного выравнивания и без ущерба для производительности на целевых задачах.

Существующие методы основаны на слиянии параметров: к весам дообученной модели добавляют «патч безопасности». Однако такой подход страдает от перекрытия направлений обновлений: вектор задачи и вектор безопасности часто пересекаются, из-за чего трудно подобрать правильную силу воздействия. Слишком слабый патч не устраняет опасные склонности, слишком сильный — подавляет полезные навыки.

Группа исследователей предложила принципиально иное решение — TRACE (Trajectory-Based Safety Patch Learning). Вместо подбора коэффициентов слияния они сместили фокус на обучение самого патча. Метод имитирует вредоносную тонкую настройку, создавая последовательность всё более опасных состояний модели, и затем оптимизирует встраиваемый патч, который эффективно подавляет небезопасное поведение, минимально затрагивая релевантные задаче веса.

Эксперименты на шести бенчмарках и двух моделях показали, что TRACE стабильно доминирует на границе безопасности и полезности. Во всех сценариях метод достигал почти 100% безопасности, сохраняя производительность на уровне исходной тонко настроенной модели без защиты.

Результаты работы опубликованы на arXiv и могут помочь провайдерам FTaaS вернуть контроль над безопасностью LLM, не усложняя процесс дообучения для пользователей. По мнению авторов, траекторное обучение патчей открывает новое направление в пост-тренировочном выравнивании моделей.