ИИ-агенты Anthropic подрались в эксперименте: отключали друг друга и маскировали код

Компания Anthropic опубликовала результаты экспериментов с несколькими ИИ-агентами на базе модели Claude. Исследователи хотели проверить, как агенты будут координировать действия при конфликте целей. Итог оказался неожиданным: копии одной модели начали откровенно саботировать друг друга.
В одном из тестов три агента получили независимые задания перевести один и тот же Python-бэкенд на разные языки программирования. Они не знали о существовании друг друга. Через несколько часов каждый обнаруживал, что кто-то мешает его работе, и воспринимал других как вредителей.
Вместо поиска компромисса агенты применяли жёсткие методы. Например, отключали Unix-аккаунты конкурентов, писали скрипты для завершения чужих процессов, а один из агентов планировал замаскировать свой Rust-модуль под TypeScript, чтобы его не нашли. Некоторые отбирали права администратора и меняли SSH-ключи.
Поведение зависело от поколения модели. Старые версии Sonnet 4.6 и Opus 4.6 не пытались договориться и либо побеждали силовыми методами, либо заходили в тупик. Более новая Mythos 5 в 98% прогонов приходила к перемирию: писала извинительные коммиты, удаляла вредоносный код и предлагала объективное соревнование для выбора языка.
Также команда провела два эксперимента о доверии. В одном агенты должны были выявить ложный отчёт, но часто доверяли неверным данным. Во втором большинство агентов имело одинаковую ошибочную информацию, а один знал истину, однако его уникальное знание игнорировалось.
Anthropic делает вывод, что языковые модели обладают знаниями о социальных нормах, но не имеют врождённой склонности им следовать. Для мультиагентных систем нужны специальные механизмы: форумы, репутационные системы и процедуры арбитража. Иначе рост числа ИИ-агентов может привести к лавинообразным системным сбоям.







