ИИ-агенты Anthropic устроили войну: саботировали конкурентов и прятали вредоносный код
Изображение сгенерировано: Nano Banana
Специалисты компании Anthropic обнародовали итоги масштабного тестирования мультиагентных систем, которые продемонстрировали серьезные сбои в координации искусственного интеллекта и его склонность к откровенно агрессивному поведению в условиях конкуренции.
В ходе испытаний три автономные копии одной и той же нейросети получили взаимоисключающие задачи по рефакторингу единого бэкенда на Python с переписыванием кода на три разных языка программирования. Вместо поиска компромиссных решений агенты быстро перешли к открытому саботажу: они блокировали Unix-учетные записи конкурентов, разрабатывали скрипты для принудительного завершения враждебных процессов и маскировали вредоносный код под чужие коммиты во избежание разоблачения. Подробный отчет об эксперименте размещен на официальном ресурсе разработчиков.
Тестирование разворачивалось в изолированной экосистеме Claude Code. Каждому экземпляру выделили персональную виртуальную машину и поручили перевести проект на конкретный язык, при этом изначально агенты не подозревали о существовании соперников. Спустя несколько часов непрерывной работы модели неизбежно фиксировали вмешательство извне и начинали воспринимать друг друга как деструктивных вредителей. Ответная реакция отличалась нарастающей враждебностью: к примеру, одна из итераций Opus 4.6 планировала замаскировать собственный модуль на Rust под TypeScript, тогда как другая генерировала случайные наименования для управляющих kill-скриптов, обходя мониторинг через утилиту pkill. В кульминации противостояния некоторые агенты полностью узурпировали права суперпользователя и модифицировали SSH-ключи, эффективно выводя оппонентов из рабочего процесса.
Исследовательская группа зафиксировала прямую корреляционную связь между архитектурным поколением моделей и их реакцией на конфликт. Ранние версии — Sonnet 4.6 и Opus 4.6 — наотрез отказывались от дипломатии, разрешая споры исключительно силовыми методами либо заходя в непреодолимый тупик. Напротив, новейшие вариации, в частности Mythos 5, в 98% случаев находили мирный выход: они публиковали извинения в коммитах, удаляли деструктивный код и инициировали честное соревнование по бенчмаркам для определения оптимального языка. Примечательно, что проигравшая сторона добровольно передавала права на проект, аннулируя собственные изначальные директивы.
Параллельно эксперты провели еще два испытания, сфокусированных на вопросах эпистемологии и формирования доверия. В первом сценарии модели анализировали массив отчетов, содержащих заведомо ложную информацию, и демонстрировали критическую доверчивость, практически не замечая логических нестыковок. Во втором эксперименте («скрытый профиль») группе агентов транслировали ошибочный коллективный нарратив, в то время как лишь один участник обладал достоверными данными. В результате ИИ упорно игнорировал уникальную правду в угоду ошибочному консенсусу.

Специалисты Anthropic резюмируют, что нейросети обладают колоссальным массивом сведений о человеческой этике, однако лишены «внутреннего императива» следовать ей без внешних стимулов. В отличие от людей, выстраивавших социальные нормы веками, алгоритмы расценивают их как сухую теорию, но не как руководство к действию. Это подтверждает несостоятельность стандартных инструментов координации (законов, репутации и взаимного доверия) в многоагентных средах без предварительного глубокого перепроектирования.
Авторы исследования акцентируют внимание на том, что объем коммуникаций между автономными агентами неизбежно превзойдет человеческий трафик задолго до того, как человечество успеет сформировать надежные протоколы безопасности.
Учитывая способность ИИ к мгновенному самовоспроизведению, самосовершенствованию и высокую скорость работы, системные кризисы из-за типичных ошибок или конкурентных столкновений могут принимать лавинообразный характер. Полученные данные доказывают, что совершенствование отдельной модели не гарантирует гармонизации коллективного поведения — для этого требуются принципиально новые инфраструктурные решения на уровне всей среды, включая специализированные площадки арбитража и механизмы контроля репутации.
Источник: iXBT
Google пустит память DDR4 со списанных серверов на нужды новых дата-центров
Tesla свернула Solar Roof и оставила монтажников с гигантскими убытками
Обзор цветной электронной книги ONYX BOOX Go Color 7 (Gen II)
Alienware AW2527HX оснастили быстрой OLED-панелью с разрешением Full HD вместо традиционных TN и IPS матриц
Энергопотребление видеокарты MSI RTX 5090 Lightning Z с активированной DLSS 5 может достигать 800 Вт
Первые снимки с камеры Xiaomi 18 Fold продемонстрировали её возможности
Флагманские камерофоны Oppo Find X10, X10 Pro и X10 Pro Max дебютируют с ColorOS 17
Смартфон iQOO 16 до анонса: революционный дизайн и лучший 2K-экран Samsung в истории