Ученые показали, как извлекать персональные данные из языковых моделей
Исследователи представили вероятностный метод анализа утечки тренировочных данных из языковых моделей, работающий в условиях черного ящика. Работа опубликована на arXiv и описывает ограничения стандартных метрик, а также новый инструмент аудита под названием leakit.
Традиционная оценка membership inference атак (MIA) обычно опирается на агрегированный показатель ROC-AUC. Однако, как показали авторы, такие метрики не отражают реального вреда: слепые базовые модели, не имеющие доступа к внутренностям LLM, уже разделяют «своих» и «чужих» по поверхностным признакам текста. Например, на наборе WikiMIA простая модель на основе мешка слов достигает AUC 0.97, а добавление выборок из модели ничего не улучшает.
Главный вывод работы: усредненные показатели скрывают точечные утечки. На модели Pythia-6.9B исследователи обнаружили, что для 83 из 500 документов Pile (16.6%) модель воспроизводит точный идентификатор, например email, и при этом не воспроизводит его при контрольном измененном префиксе. Это доказывает, что утечка связана именно с конкретным документом, а не с общей статистикой текста.
Риск утечки растет с размером модели: с 5.6% для модели с 410M параметров до 16.6% для 6.9B. При этом утечка неравномерна: в коде идентификаторы воспроизводятся примерно в три раза чаще, чем в прозе. Для прозы показатель также положительный и растет с размером — с 4.0% до 12.1%.
Авторы также проверили влияние различных параметров генерации. Оказалось, что температура и nucleus-сэмплирование почти не влияют на утечку, а для извлечения достаточно префикса из 16 токенов. Дедупликация корпуса, вопреки ожиданиям, не снижает риск.
Исследователи призывают пересмотреть практику аудита конфиденциальности: вместо одного числа AUC следует оценивать извлечение по каждому документу отдельно, с разбивкой по доменам. Предложенный инструмент leakit позволяет проводить такие проверки на черном ящике и доступен для использования.



