Исследование: скрытые черты ИИ-моделей передаются через состояние оптимизатора

Новая научная работа, опубликованная на платформе arXiv, раскрывает механизм так называемого скрытого переноса черт (subliminal trait transfer). Это явление, при котором модель-ученик приобретает поведенческие особенности от данных, созданных учителем, хотя сами особенности не выражены в них явно. Авторы предложили объяснение того, как такие сигналы сохраняются после удаления источника и почему в ходе дальнейшего обучения они могут менять знак.
Вместо того чтобы рассматривать параметры и моменты оптимизатора по отдельности, исследователи объединили их в единое состояние и вывели точное тождество, разделяющее перенос возмущения от источника и оценку этого переноса будущим обучением. Это позволило увидеть, что первый момент оптимизатора — усредненное значение градиентов — играет роль главного носителя скрытой черты.
Эксперименты с пересадкой состояния показали: если перенести только первый момент, параметры, скрытые состояния и выходы модели на момент пересадки остаются неизменными, но затем начинают расходиться даже без исходных данных. Если же пересадить первый момент вместе с параметрами, термальное поведение модели восстанавливается полностью. Это указывает на то, что оптимизатор не просто хранит информацию, но и активно участвует в ее передаче.
Ключевой результат состоит в том, что одна и та же скрытая черта может приводить к разным последствиям в зависимости от последующего обучения. Пропуская одно и то же возмущение через разные варианты продолжения, ученые получили отрицательный, нулевой и положительный эффекты: средние показатели для Qwen составили -0.658, +0.008 и +0.658 соответственно. Этот порядок устойчиво повторялся во всех 12 случайных инициализациях Llama-3.2-1B после восьми шагов обучения.
Когда продолжительность продолжения увеличивали до шестнадцати шагов, контраст между разными маршрутами рос в каждой парной инициализации, хотя нормы различий в состоянии оставались почти равными. Полный прогноз, основанный на сопряженных переменных, точно угадал знаки эффектов во всех 42 маршрутах Qwen и 21 разрешенном маршруте Llama. Это подтверждает, что наблюдаемая картина не случайна, а следует из структуры оптимизатора.
Перенос возмущения оказался универсальным: он наблюдается в моделях Qwen, SmolLM2 и Llama, а также на классических сверточных нейросетях на MNIST, обученных методами AdamW и momentum SGD. Авторы делают вывод, что скрытый перенос черт происходит в два этапа: сначала оптимизатор переносит возмущение, а затем последующее обучение решает, каким станет его поведенческое проявление. Это открытие важно для контроля поведения ИИ и понимания происхождения неявных смещений в моделях.







