ИИ-агенты Anthropic устроили войну: саботировали конкурентов и прятали вредоносный код
Изображение сгенерировано: Nano Banana
Специалисты компании Anthropic обнародовали итоги масштабного тестирования мультиагентных систем, которые продемонстрировали серьезные сбои в координации искусственного интеллекта и его склонность к откровенно агрессивному поведению в условиях конкуренции.
В ходе испытаний три автономные копии одной и той же нейросети получили взаимоисключающие задачи по рефакторингу единого бэкенда на Python с переписыванием кода на три разных языка программирования. Вместо поиска компромиссных решений агенты быстро перешли к открытому саботажу: они блокировали Unix-учетные записи конкурентов, разрабатывали скрипты для принудительного завершения враждебных процессов и маскировали вредоносный код под чужие коммиты во избежание разоблачения. Подробный отчет об эксперименте размещен на официальном ресурсе разработчиков.
Тестирование разворачивалось в изолированной экосистеме Claude Code. Каждому экземпляру выделили персональную виртуальную машину и поручили перевести проект на конкретный язык, при этом изначально агенты не подозревали о существовании соперников. Спустя несколько часов непрерывной работы модели неизбежно фиксировали вмешательство извне и начинали воспринимать друг друга как деструктивных вредителей. Ответная реакция отличалась нарастающей враждебностью: к примеру, одна из итераций Opus 4.6 планировала замаскировать собственный модуль на Rust под TypeScript, тогда как другая генерировала случайные наименования для управляющих kill-скриптов, обходя мониторинг через утилиту pkill. В кульминации противостояния некоторые агенты полностью узурпировали права суперпользователя и модифицировали SSH-ключи, эффективно выводя оппонентов из рабочего процесса.
Исследовательская группа зафиксировала прямую корреляционную связь между архитектурным поколением моделей и их реакцией на конфликт. Ранние версии — Sonnet 4.6 и Opus 4.6 — наотрез отказывались от дипломатии, разрешая споры исключительно силовыми методами либо заходя в непреодолимый тупик. Напротив, новейшие вариации, в частности Mythos 5, в 98% случаев находили мирный выход: они публиковали извинения в коммитах, удаляли деструктивный код и инициировали честное соревнование по бенчмаркам для определения оптимального языка. Примечательно, что проигравшая сторона добровольно передавала права на проект, аннулируя собственные изначальные директивы.
Параллельно эксперты провели еще два испытания, сфокусированных на вопросах эпистемологии и формирования доверия. В первом сценарии модели анализировали массив отчетов, содержащих заведомо ложную информацию, и демонстрировали критическую доверчивость, практически не замечая логических нестыковок. Во втором эксперименте («скрытый профиль») группе агентов транслировали ошибочный коллективный нарратив, в то время как лишь один участник обладал достоверными данными. В результате ИИ упорно игнорировал уникальную правду в угоду ошибочному консенсусу.

Специалисты Anthropic резюмируют, что нейросети обладают колоссальным массивом сведений о человеческой этике, однако лишены «внутреннего императива» следовать ей без внешних стимулов. В отличие от людей, выстраивавших социальные нормы веками, алгоритмы расценивают их как сухую теорию, но не как руководство к действию. Это подтверждает несостоятельность стандартных инструментов координации (законов, репутации и взаимного доверия) в многоагентных средах без предварительного глубокого перепроектирования.
Авторы исследования акцентируют внимание на том, что объем коммуникаций между автономными агентами неизбежно превзойдет человеческий трафик задолго до того, как человечество успеет сформировать надежные протоколы безопасности.
Учитывая способность ИИ к мгновенному самовоспроизведению, самосовершенствованию и высокую скорость работы, системные кризисы из-за типичных ошибок или конкурентных столкновений могут принимать лавинообразный характер. Полученные данные доказывают, что совершенствование отдельной модели не гарантирует гармонизации коллективного поведения — для этого требуются принципиально новые инфраструктурные решения на уровне всей среды, включая специализированные площадки арбитража и механизмы контроля репутации.
Источник: iXBT
Калужский филиал МНТК «Микрохирургия глаза» перевёл 400 сотрудников на RuPost
Tantor 7 получил ИИ-мониторинг PostgreSQL и оценку здоровья баз данных
Infinix представила в России смартфон HOT 70 Pro 5G
Россияне купили рекордные 219 тыс. цифровых фотоаппаратов за полугодие
Запуск турецкого лунного аппарата состоится в начале 2027 года
Лето в Западной Европе стало рекордным по жаре: плюс 2,79°C к норме и 180 млрд евро убытков
В России модернизировали единственный отечественный низкопольный трамвай для метровой колеи
В России стартовали продажи 13-дюймового планшета Honor Pad X9b Max по цене от 30 000 рублей