Побочные эффекты управления активациями языковых моделей стали предсказуемыми

Техника activation steering позволяет менять поведение языковой модели без переобучения: к скрытым активациям добавляется специально вычисленное направление. Такой подход эффективен, но часто вызывает нежелательные побочные эффекты на другие функции модели. Новое исследование, опубликованное на arXiv, показывает, что эти эффекты можно прогнозировать до применения steering.

Ученые построили кросс-эффектную матрицу, охватывающую 67 различных поведений, и проверили ее на трех открытых языковых моделях. Выяснилось, что побочные эффекты возникают довольно часто, имеют структурированный характер и часто асимметричны. То есть влияние одного поведения на другое не всегда взаимно, и это нельзя объяснить только сходством между задачами.

Главный результат исследования — предсказуемость. Величина побочного эффекта в основном зависит от того, какое поведение является целевым. А вот направление эффекта можно предсказать, анализируя представления модели до применения steering. Точность такого прогноза значительно выше, чем у простых базовых методов.

Авторы использовали данные о внутренних представлениях модели и применили методы машинного обучения для прогнозирования. Это позволило выявить закономерности, которые не видны при поверхностном анализе. Например, некоторые поведения оказываются связанными неочевидным образом, и это важно учитывать при настройке моделей.

Практическое значение работы заключается в возможности проактивного аудита безопасности. Если побочные эффекты предсказуемы, то до развертывания модели можно оценить риски и решить, стоит ли применять steering в конкретном случае. Это делает технику более пригодной для реального использования в продуктах и сервисах.

Исследование размещено на arXiv под идентификатором 2608.11227. Точная дата публикации не указана, но работа уже доступна для ознакомления. Авторы не раскрывают деталей о конкретных моделях, но отмечают, что все они относятся к категории открытых.

Таким образом, управление активациями становится более прозрачным и управляемым. Возможность заранее оценивать последствия позволит разработчикам безопаснее применять technique для настройки поведения ИИ-систем.