Нейросети хранят уникальный след: учёные доказали, что после схождения модели всё ещё различимы
Независимо обученные нейронные сети не имеют общего референсного фрейма для индексов нейронов, поэтому их сравнение требует учёта координатной свободы. Проблема усугубляется так называемым «нейронным коллапсом» — явлением, когда сети сходятся к общей низкоразмерной геометрии.
В новой работе на arXiv исследователи задались вопросом: остаётся ли функциональное разнообразие отдельных моделей различным после схождения? Они выделили три аспекта — обнаруживаемость, переносимость и причинную устойчивость — и сфокусировались на первом.
Для эксперимента были обучены пять независимых сетей на датасете MNIST. Затем с помощью проверенного аффинного выравнивания «донорские» головы сетей были отображены в координаты «реципиента». После корректировки базового уровня реципиента удалось различить донор-специфичные функциональные отпечатки.
Результат: все 20 упорядоченных пар «донор-реципиент» были правильно идентифицированы с точной перестановочной значимостью p=0.0083. Метод оказался устойчивым к аудиту утечки информации.
Авторы подчёркивают, что полученные данные устанавливают только обнаруживаемость в рамках использованного теста, но не говорят о переносимости или причинной устойчивости. Работа демонстрирует, как выравнивание, диагностика неоднозначности и контроль утечек позволяют тестировать межсетевую вариацию в контролируемых условиях. Обобщение этих выводов за пределы эксперимента остаётся открытым вопросом.




