Новый бенчмарк оценил устойчивость удаления знаний из языковых моделей
Международная группа исследователей разработала новый бенчмарк для оценки механизмов машинного забывания (machine unlearning) в больших языковых моделях. Работа опубликована на платформе arXiv под идентификатором 2608.04519 и посвящена проблеме гарантированного удаления конфиденциальных данных из нейросетей.
Существующие тесты, как отмечают авторы, в основном состоят из простых вопросов и узкого набора многошаговых запросов. Это не отражает реальных сценариев, где знание может просачиваться через разнообразные цепочки рассуждений, а удалённая информация — частично восстанавливаться атаками. Новый бенчмарк учитывает оба фактора.
Эксперименты проводились на трёх моделях, шести методах забывания и двух тщательно подготовленных наборах данных. Результаты показали, что все существующие подходы уязвимы: модель способна выдать удалённые сведения, если задать вопрос через обходные логические пути, а лёгкая дообучение после удаления позволяет частично восстановить информацию.
Авторы также изучили компромисс между качеством забывания, устойчивостью к восстановлению и сохранением общей полезности модели. Выяснилось, что повышение защиты часто приводит к ухудшению других показателей, что делает задачу создания по-настоящему безопасных систем непростой.
Разработка подобных бенчмарков важна для регуляторов и разработчиков, которые внедряют требования по удалению данных (например, в соответствии с GDPR). Без надёжных методов оценки невозможно гарантировать, что модель действительно забыла информацию, а не просто скрыла её.
Предложенный подход может лечь в основу новых стандартов тестирования, а также стимулировать разработку более совершенных алгоритмов забывания, сочетающих защиту и функциональность.


