Обзор LLM Unlearning: ученые выясняют, как заставить нейросети забывать приватные данные

Большие языковые модели (LLM) все активнее внедряются в критически важные системы — здравоохранение, финансы, образование. Однако их неспособность «забывать» информацию создает серьезные риски для кибербезопасности и приватности. Личные данные, авторские материалы и опасные знания остаются в модели даже после развертывания.

Как отмечают авторы нового обзора на arXiv, инциденты уже происходят: чат-боты воспроизводят приватные данные, а выдуманные юридические цитаты приводят к реальным финансовым потерям. Проблема перешла из разряда гипотетических в актуальную угрозу.

Полное переобучение моделей с миллиардами параметров при каждом изменении данных невозможно — это требует огромных вычислительных ресурсов. К тому же знания в LLM распределены и переплетены между параметрами, а не локализованы в отдельных блоках.

Решением стала технология LLM Unlearning — «забывание» для нейросетей. Она позволяет удалять или подавлять целевую информацию без переобучения и без потери остальных знаний. Наибольшее распространение получили методы на основе градиентов — они совместимы с существующими пайплайнами и масштабируются до миллиардов параметров.

Однако центральный вопрос остается открытым: действительно ли модель забывает информацию или лишь перестает ее демонстрировать при обычных подсказках? Возможно, злоумышленник с помощью специальных атак все же сможет восстановить удаленные данные.

Авторы обзора подчеркивают: для кибербезопасности важно не только добиться внешнего «забывания», но и проверить его необратимость. Это требует разработки новых методов верификации и устойчивости к атакам. Исследование систематизирует текущие подходы и намечает дальнейшие шаги в этой области.