JUMP: новая атака на диффузионные языковые модели определяет данные обучения за один проход
Группа исследователей опубликовала в архиве arXiv препринт, описывающий новый метод атаки на диффузионные языковые модели (dLLM) под названием JUMP. Атаки проверки членства (Membership Inference Attacks, MIA) позволяют злоумышленнику выяснить, использовался ли конкретный фрагмент текста при обучении модели. В случае дообученных моделей это ставит под угрозу конфиденциальность данных.
Предыдущий метод SAMA для dLLM имитировал функцию потерь, усредняя сигналы восстановления по множеству случайных масок, что требовало большого числа запросов к целевой и референсной моделям. JUMP принципиально иной: он использует два ключевых свойства диффузионных языковых моделей — возможность декодирования в любом порядке и параллельное декодирование.
Сначала JUMP выбирает позиции с низкой уверенностью референсной модели (low-reference-confidence positions) — то есть те токены, которые модель восстанавливает с наименьшей вероятностью. Затем все выбранные позиции маскируются одновременно, и за один совместный запрос к целевой и референсной моделям вычисляется статистика разницы реконструкции (clipped target/reference reconstruction-gap).
Тестирование проводилось на дообученной модели LLaDA-8B-Base на шести наборах данных из бенчмарка MIMIR. JUMP существенно улучшил метрику ROC-AUC — с 0,82 до 0,90 по сравнению с SAMA. Особенно заметен прирост при низких значениях уровня ложноположительных срабатываний, что важно для практических сценариев атак.
Важно, что JUMP выполняет всего один проход выбора и один оценочный проход через целевую и референсную модели, что делает атаку значительно более эффективной по числу запросов. Это потенциально снижает порог для практического применения подобных атак, так как уменьшает вычислительную нагрузку и риск обнаружения.
Работа подчёркивает, что диффузионные языковые модели, несмотря на свои преимущества, могут быть уязвимы к атакам на приватность. Разработчикам таких моделей стоит учитывать возможность подобных атак при проектировании систем и механизмов защиты.


