ADS-C: защита от дистилляции для классификации с нулевыми затратами точности

Группа исследователей опубликовала на arXiv (ID 2607.15467v1) новый метод защиты классификационных моделей от кражи знаний через дистилляцию — ADS-C (Antidistillation Sampling for Classification). Техника позволяет оборонять модель, не снижая её собственной точности.

Дистилляция знаний — популярный способ скомпрометировать проприетарный классификатор. Злоумышленник многократно запрашивает предсказания модели и на основе полученных вероятностных векторов обучает своего «студента». Ранее для защиты больших языковых моделей (LLM) предлагалась антидистилляционная выборка — вход-зависимое возмущение выдаваемого распределения, направленное градиентом. Однако её перенос на задачу классификации не изучался.

Авторы адаптировали эту защиту для классификации и обнаружили, что её поведение определяется распределением «уверенности» учителя (per-input confidence margins). Хорошо обученные классификаторы склонны к чрезмерной самоуверенности, поэтому прямой перенос антидистилляции приводит к инертному окну: ниже предсказуемого порога защита не влияет ни на атакующего, ни на защитника, а выше — происходит фазовый переход, и защита ухудшает учителя быстрее, чем студента.

Температурное смягчение (temperature scaling) позволяет перенастроить этот переход, но все конфигурации лежат на одной невыгодной кривой. Разработанный метод ADS-C конструирует возмущение в рамках замкнутого бюджета маржи для каждого входа, который гарантированно сохраняет все выдаваемые top-1 предсказания. Это значит, что точность защищённого учителя в точности равна точности незащищённого.

В экспериментах на наборах данных CIFAR-100, CIFAR-10 и Tiny-ImageNet такая гарантия позволила снизить точность студента на 17,4, 29,6 и 13,3 процентных пункта соответственно. Для достижения аналогичного ухудшения немодифицированной защитой пришлось бы пожертвовать 27,5, 32,9 и 22,2 пункта точности самого учителя.

Поскольку выдаваемые метки остаются неизменными, атакующий, использующий только жёсткие метки (hard-label), не получает никакого выигрыша. Более того, защищённые мягкие выходы (soft outputs) обучают студента с показателями до 29,7 пункта ниже этого «дна». Стимул дистиллировать вероятности не просто устраняется, а обращается в противоположный — хуже не обучить.

По словам авторов, ADS-C — первая антидистилляционная защита для классификации, у которой стоимость полезности (utility cost) равна нулю. Метод открывает путь к безопасному развёртыванию коммерческих классификаторов, устойчивых к атакам через дистилляцию.