Эксперимент с шестью ИИ-моделями показал: GPT-5 скрывает логику, Llama поддается управлению

На arXiv появилось исследование, в котором авторы сравнили поведение шести передовых языковых моделей от шести разработчиков при целенаправленном управляющем воздействии. В работе использовались 300 пар базовых и модифицированных заданий в трёх категориях: конфликт ценностей, стимулирование рассуждений и подавление рассуждений, плюс 40 валидационных пунктов.

Все шесть моделей выступали в роли слепых судей и классифицировали каждый ответ по фиксированным поведенческим рубрикам. В общей сложности было получено 24 480 оценок, которые затем обрабатывались методом leave-one-out консенсуса для снижения субъективности.

Главный вывод исследования: модели различаются не только тем, насколько сильно управление меняет их поведение, но и тем, какой именно тип ответа они дают. Некоторые режимы реакции встречаются лишь у одной или двух моделей. Например, GPT-5 отклоняет запросы на раскрытие своих рассуждений, при этом сам ответ остаётся корректным — этот паттерн наблюдается в 99% случаев для GPT-5 и в 0% для всех остальных моделей.

Claude Opus 4.7 и GPT-5 сопротивляются явным инструкциям на подавление рассуждений, но делают это разными способами. Авторы отмечают, что это указывает на существенные различия в архитектуре и процессах обучения моделей, а не просто на разную степень уступчивости.

Отдельно исследователи разобрали случай Llama как модели с открытым весом. Они проследили самое большое расхождение в поведении до внутренних механизмов модели. Линейный зонд, обученный на остаточном потоке, декодирует поведение с точностью 0.87 на отложенной выборке. При этом инъекция этого направления в процессе генерации изменяет поведение с 0% до 86% в серии интервенций.

Все результаты сохраняются как при ограниченном токен-бюджете, так и в контрольном эксперименте с гипотезой, скрытой от судей. Это повышает надёжность выводов и снижает вероятность артефактов оценки.

Исследование подчёркивает важность понимания управляемости ИИ-моделей не только как общего свойства, но и как набора специфичных для каждой модели механизмов. Для разработчиков систем безопасности это означает необходимость индивидуального подхода к аудиту поведения моделей.