Бэкдор-атака PFBA: несправедливость в мультимодальных ИИ сохраняется даже после дообучения

Исследователи представили метод PFBA (Persistent Fairness Backdoor Attack) — бэкдор-атаку на мультимодальные большие языковые модели (MLLM). Она позволяет внедрить в модель скрытые триггеры, которые вызывают устойчивые нарушения справедливости даже после серии обновлений через continual learning. Работа опубликована в архиве препринтов arXiv.

Такие модели все чаще используются в ответственных областях, где важно равное отношение ко всем группам пользователей. При этом системы постоянно дообучаются на новых данных, чтобы адаптироваться к изменяющимся задачам. Ранее считалось, что наивно внедренные бэкдоры со временем деградируют при последующих обновлениях.

Авторы PFBA предложили два ключевых механизма. Первый — Latent Space Fairness Reinforcement — изменяет геометрию глубоких признаков модели: представления привилегированной группы закрепляются для сохранения полезности, а представления целевой группы группируются и отталкиваются, что поддерживает дискриминацию.

Второй механизм — Continual Learning Simulation — итеративно оптимизирует триггер против имитируемого дрейфа параметров. Так обеспечивается сохранение бэкдора при будущих обновлениях модели.

В ходе экспериментов авторы зафиксировали серьезные нарушения справедливости, которые сохраняются на протяжении нескольких раундов continual learning. Атака также обходит стандартные механизмы защиты от бэкдоров.

Данные и код проекта доступны на GitHub. Исследование подчеркивает риски, связанные с безопасностью и справедливостью мультимодальных ИИ-систем, а также важность проверки моделей на всех этапах их жизненного цикла.