Траекторные метрики PGD не заменяют стандартную оценку робастности нейросетей
Оценка устойчивости нейросетей к атакующим примерам — одна из ключевых задач в области безопасности ИИ. Наиболее распространённый метод — проектный градиентный спуск (PGD), который моделирует атаку на модель. Традиционно робастность измеряется финальной точностью модели на атакующих примерах, но этот показатель не отражает поведение модели в процессе атаки.
В новой работе, опубликованной на arXiv, исследователи предложили использовать траекторные диагностики: динамику функции потерь, выравнивание градиентов и количество шагов до ошибки (steps-to-failure). Предполагалось, что они дадут более глубокое понимание оптимизационной динамики атак. Однако авторы проверили, насколько эти метрики действительно коррелируют с силой робастности.
Эксперименты проводились на сверточных нейросетях, обученных на датасете Fashion-MNIST. Сравнивались модели, обученные стандартно и с применением адиверсального обучения (adversarial training), в нескольких режимах робастности. Для измерения использовались 20-шаговые PGD-атаки со случайной инициализацией и несколькими повторами, а траектории записывались на 3000 корректно классифицированных примерах для каждой модели.
Результаты показали, что иерархия робастности между моделями воспроизводится, но вклад траекторных метрик в её установление неодинаков. Средняя динамика потерь и паттерны выравнивания градиентов оказались количественно схожими у адиверсально обученных моделей, даже при существенно разной точности устойчивости. Это означает, что по этим метрикам нельзя надёжно отличить более устойчивую модель от менее устойчивой.
Зато распределение шагов до отказа показало более чёткое разделение режимов робастности и прямо отражало функциональную сопротивляемость модели возмущениям. По мнению авторов, траекторные диагностики описывают геометрию оптимизации, но не являются самостоятельным измерителем адиверсальной робастности.
Таким образом, интерпретация таких метрик зависит от режима робастности, силы атаки и использования нескольких метрик одновременно. Траекторный анализ может служить лишь дополнительным инструментом диагностики, а не заменой стандартных измерений. Это важное уточнение для специалистов по безопасности ИИ, которые всё чаще обращаются к подобным методам для оценки моделей.




