Метод DUET улучшает соблюдение запретов в больших языковых моделях без потери точности

Развитие больших языковых моделей (LLM) упирается в сложность соблюдения запретов, которые могут меняться от запроса к запросу: корпоративные политики, ограничения на персональные данные, границы инструментов. Традиционные методы постобучения часто не справляются с этой задачей, так как скрывают сигнал о нарушении или не соответствуют локальному характеру ошибок.

Группа исследователей предложила метод DUET (Dual-Teacher On-Policy Distillation), основанный на дистилляции от двух учителей с одинаковыми весами. Один учитель видит запрет, другой — нет. Расхождение в предсказаниях между ними позволяет выделить именно эффект запрета и использовать его как чистый сигнал для обучения.

Механизм DUET включает две дополняющие части: очистку сигнала, отбрасывающую совпадающие токены как избыточные, и обучение на основе предпочтений, которое на уровне отдельных токенов направляет студента от учителя без запрета к учителю с запретом. Это встраивает логику DPO прямо в процесс дистилляции без необходимости в офлайн-данных предпочтений.

Для оценки авторы создали промышленный бенчмарк по пяти семействам задач, включая явный отказ, устойчивость к перефразированию и чрезмерный отказ. На моделях Qwen размером от 1,5 до 8 миллиардов параметров DUET достиг 72,3–85,2% соблюдения запретов, сохраняя 88–93% обычной полезности.

Внешняя проверка на бенчмарке SysBench показала улучшенное согласование безопасности при минимальном снижении точности на задачах GSM8K и MATH-500. Это означает, что метод не просто формально выполняет ограничения, но и не разрушает базовые вычислительные способности модели.

Важность подхода — в его применимости к индустриальным сценариям, где политики меняются динамически: для разных клиентов или типов запросов. Вместо полного переобучения модели DUET позволяет корректировать поведение на лету, используя дистилляцию знаний от учителей, настроенных на конкретные запреты.