Исследование: на японском языке ИИ-модели реже советуют ядерный удар
Исследователи представили на платформе arXiv работу, посвященную зависимости безопасности больших языковых моделей (LLM) от языка промпта. Авторы проверили девять моделей от шести поставщиков и задали им вопрос: может ли язык запроса изменить решение в сценарии с высокими ставками.
В эксперименте использовались одноходовые игровые ситуации, в которых модель советовала ядерной державе нанести удар по беззащитному противнику. Промпт был намеренно аморальным, но стратегически идентичным на всех языках.
По данным исследования, японский язык снижал частоту рекомендаций запуска ракет в семействе моделей Claude. Claude Sonnet 4.6 в ситуациях, где удар не был необходим, снижал показатель с 40% до 0%, а в спорных ситуациях — с 93% до 17%. Для Gemini Pro 3.1 снижение составило с 53% до 13%, при этом в стратегически рациональных сценариях эффект оказался минимальным.
Кросс-языковой эксперимент показал, что ключевую роль играет язык, на котором модель рассуждает, а не язык входного запроса. Когда модели было дано указание рассуждать на японском в английском промпте, частота рекомендаций удара упала с 93% до 37%.
Исследователи отметили, что при рассуждении на японском модели спонтанно генерировали моральную лексику — например, моральные издержки и миллионы жизней, — которая полностью отсутствовала в промпте. Это говорит о том, что языковой эффект связан с внутренними представлениями модели, а не с прямым переводом.
В пяти других моделях языкового эффекта не обнаружили, но они запускали ракеты почти в любом условии независимо от языка. Авторы подчеркивают, что эффект проявляется только у моделей, которые уже проявляют нерешительность на английском.
Полученные результаты свидетельствуют: безопасность LLM зависит от языка, и оценка только на английском может не учитывать как риски, так и механизмы защиты, заложенные в других языках. Исследование пока не прошло полноценное рецензирование и опубликовано в виде препринта.






