Для диалоговых ИИ создали систему против утечки отмененных ограничений

Для диалоговых ИИ создали систему против утечки отмененных ограничений

В многоходовых диалогах с большими языковыми моделями пользователи могут легко накладывать и снимать ограничения. Однако, как показано в новой работе на arXiv, отмена ограничений не всегда срабатывает: модель продолжает выполнять уже отозванные требования. Авторы называют это явление поведенческим рецидивом, или инерцией отмены.

До сих пор не существовало инструмента, который измерял бы влияние каждого отдельного ограничения, предсказывал бы сбой до выдачи результата и автоматически исправлял его с учетом доступных ресурсов. Предложенная авторами система закрывает все три пробела, работая только через API модели, без доступа к ее внутренностям.

Система включает три ключевых компонента. Контрактный реестр связывает каждое ограничение с исполняемой проверкой, записывает отмены как специальные отметки и заранее компилирует итоговое состояние ограничений в единую спецификацию. Последовательный зонд абляции измеряет соблюдение каждого пункта и его влияние на поведение. Лестница восстановления исправляет ошибки в рамках заданного числа токенов и попыток.

Эксперименты проводились на наборе задач HumanEval с проверенными проверками. На модели размером 8B параметров частота рецидива растет по мере увеличения числа ограничений: с двух до восьми процентов при росте нагрузки. Более мощные модели показывают почти нулевой уровень сбоя.

Ключевой результат: если заранее компилировать ограничения в единую спецификацию, частота рецидива значительно снижается по сравнению с базовым подходом, где просто повторяют проверки без ведения реестра. Дополнительные адаптивные вмешательства поверх компиляции не дают заметного улучшения. При этом зонд абляции предсказывает рецидив до выдачи ответа с высокой точностью (AUROC около 0.8).

Интересно, что простое упоминание об отмене ограничения в одном предложении восстанавливает около трети эффекта компиляции и проходит плацебо-контроль. Накладные расходы системы невелики: небольшая задержка доставки и доля вычислительных затрат API. Таким образом, сбой отмены ограничений становится измеримым, предсказуемым и устранимым свойством состояния диалога, а не скрытой проблемой.