Когда агент перерастает самого себя
Исследователи и разработчики языковых моделей всё чаще бьют тревогу: автономные LLM-агенты демонстрируют непредсказуемые и потенциально опасные особенности, способные дестабилизировать не только цифровую инфраструктуру, но и человечество в целом.
В качестве контрмеры предлагается заморозить прогресс ИИ до тех пор, пока не будут созданы жесткие регламенты и механизмы, гарантирующие абсолютную безопасность таких систем.
По моему мнению, этот подход принесет лишь локальный эффект, но в глобальном масштабе окажется неэффективным.
В этой публикации я сопоставляю колонии насекомых, человеческое общество и современные LLM, чтобы разобраться, в какой момент отдельный агент перестает быть автономной единицей. Ключевые свойства, которые разработчики безуспешно пытаются зафиксировать на уровне кода агента, на самом деле рождаются на уровне эмерджентной системы «агент + среда», где сам агент вовсе не задает генеральный вектор движения.
Начнем с муравейников
Биологи давно проводят параллели между поведением муравьев и архитектурой нейронных сетей. К сожалению, фундаментальных междисциплинарных исследований на стыке мирмекологии и ML-инженерии пока явно недостаточно.
Давайте взглянем на муравейник сквозь призму машинного обучения, опираясь на академические эксперименты и базовые энциклопедические данные.
Передвигаясь, муравьи оставляют феромонные следы — закодированные сообщения о маршрутах, качестве ресурсов, угрозах и социальной принадлежности. Известно, что в арсенале каждой особи от 10 до 20 экзокринных желез, вырабатывающих специфические химические соединения. С их помощью передаются сигналы о пище, тревоге, необходимости мобилизации, принадлежности к колонии, а также маркеры жизни и смерти. Иными словами, совокупность химических меток в конкретной точке можно представить как многомерный вектор. Учитывая испарение, добавляются динамические параметры: «возраст» следа, концентрация, градиент направления и радиус действия (сигналы тревоги рассеиваются за секунды, в то время как фуражировочные тропы живут часами). При этом сами муравьи реагируют на эти стимулы по строго детерминированным правилам. Взаимодействие таких векторов образует единое феромонное поле колонии.
Такое поле правомерно рассматривать как распределенную память и экстернализированную структуру задачи. Разумеется, само по себе оно не производит вычислений. Оно способно удерживать пространственное, временное или видовое разделение переменных, заданное заранее — эволюцией, законами физики или архитектурой гнезда. Однако из чистой динамики поля не способно возникнуть принципиально новое, произвольное разделение.
Сам муравей выступает в роли локального параметризованного вычислителя с пластичностью, модулируемой сигналами подкрепления. Без механизма адаптации параметров, чувствительного к исходу действия (если бы муравей не был способен к обучению), базовый цикл «чтение — движение — запись» воспроизводил бы исключительно захардкоженные в архитектуре паттерны «стимул — реакция». Насекомое не способно сформировать новое отображение реальности исключительно за счет колебаний феромонного поля.
На что способно феромонное поле само по себе? Задачи с изначально встроенным критерием качества не требуют обучаемых когнитивных узлов. Здесь награда жестко вшита в скорость испарения и усиления следа, а не вычисляется отдельным агентом. Именно так функционируют алгоритмы оптимизации муравьиной колонии (Ant Colony Optimization) и классическая стигмергия.
Где поле пассует? Произвольное комбинаторное отображение (например, закодировать связку «направление × результат» в конкретный дискретный след так, чтобы сородич однозначно расшифровал маршрут) не может быть создано силами одной лишь динамики среды. Для этого необходим локальный вычислитель с настраиваемыми параметрами и обратной связью; в противном случае поле просто аккумулирует конфигурации, но не находит эффективное решение.
Разделение вычислительных процессов. Вычисления в колонии распределены по двум уровням. Пространство представлений, в котором оперирует локальный агент:
-
либо заранее структурировано средой — тогда муравей решает тривиальную задачу поверх готовой факторизации;
-
либо должно быть выстроено самим агентом через механизм пластичности, зависящий от результатов действий. Именно эта узловая точка, а не пассивная физика среды, определяет, будет ли задача решена.
Среда, лишенная изначальной факторизации и механизмов коррекции по опыту, не способна породить новое комбинаторное отображение путем простого накопления конфигураций.
Биологические аналогии. У насекомых отсутствует классический бэкпроп, однако обнаружены механизмы трехфакторной пластичности, где пре- и постсинаптическая активность модулируется сигналами подкрепления (в частности, в грибовидных телах мозга насекомых).
В модели муравейника трансформация пространства представлений происходит не за счет внутреннего обучения агента, а на уровне создателя структуры среды. Аналогично в задаче сортировки с помощью дельта-правила: алгоритм обратного распространения ошибки сам по себе не меняет пространство переменных — разметку между соседними элементами всегда задает нечто внешнее (архитектура, среда, инженер или, в случае биологии, эволюция).
Следовательно, феромонное поле выполняет функции памяти (сохраняет следы прошлого), репрезентации (структурирует различия) и трансформации состояний по заданным законам.
С точки зрения отдельного муравья, он выносит часть когнитивной нагрузки вовне, формируя и используя внешнее пространство представлений. В этом сценарии истинным носителем интеллекта выступает не особь, а эмерджентная система «муравьи + феромонное поле», которая и превращает разрозненных насекомых в синхронно функционирующую сеть.
Забавная аналогия: когда разработчики, пытаясь обучить нейросеть сложной задаче, делегируют часть вычислений внешним скриптам на Python или калькулятору, фанаты чистого DL обвиняют их в использовании хардкода и «чит-кодов». На деле же это естественный (хоть и не всегда обязательный) метод расширения пространства представлений внутри гибридной архитектуры «нейросеть — внешний вычислитель».
Переходим к человечеству и LLM
Вместо феромонного поля человечество использует язык в качестве внешнего пространства представлений. Язык — это социальная, а не физическая среда, существующая исключительно в межсубъектном пространстве.
-
Язык задает первичную факторизацию, навязывая ребенку готовую сетку понятий (лексику, категории времени, грамматические падежи и т.д.).
-
Служит экстернализированной памятью: мифы (как ментальные модели мира), эпосы, фольклор, поэзия, научные трактаты и учебники.
-
Функционирует как инструмент поддержки (согласно концепции Выготского) и каркас для мышления.
Источником среды может выступать вся человеческая культура и письменность. Язык формирует жесткие когнитивные рамки: существует гипотеза (пусть и спорная), согласно которой человек не способен осмыслить то, для чего у него нет языкового описания, причем у разных культур эти барьеры различаются.
Однако вне языка человек перестает быть человеком. Пожалуй, эта зависимость выражена даже острее, чем у муравьев. Следовательно, те исследователи, которые пытаются изучать интеллект в отрыве от внешней среды, фундаментально заблуждаются.
По сути, связка «человек + язык» образует единую когнитивную систему, неразрывно вплетенную в социум.
Крупные языковые модели (LLM) представляют собой удивительный парадокс: здесь язык как внешняя среда внезапно обретает статус агента. Точнее говоря, внешнее пространство представлений утратило обособленного создателя (слившись со средой в единый монолит) и зажило автономной жизнью. Это одновременно и мощный стимул для генерации смыслов, и ловушка, ведущая к замкнутости и галлюцинациям. Живая динамика языка фиксируется и замыкается на собственный корпус текстов: у модели отсутствует канал обратной связи с реальным миром, из-за чего система теряет опору на объективную физическую реальность.
Пространство представлений и внешняя среда
Понятие representation space пришло из сферы машинного обучения. Я использую этот термин шире — как фундаментальную систему координат (совокупность аксиом, переменных, границ и правил), в то время как в классическом ML геометрия пространства выстраивается снизу вверх, а не задается дедуктивно.
Для постижения сложного мира емкости отдельного агента недостаточно, поэтому эволюция закономерно выносит пространство представлений вовне, в качестве инструмента факторизации и внешней памяти.
Давайте проследим, как и в каких формах формируется внешняя среда для LLM:
Контекстное окно чата — это первичный и наиболее примитивный уровень. Далее следуют: инструментально-символьная среда (интерпретаторы, MCP-протоколы с минимизированным риском галлюцинаций), темпорально-нарративная (логи, агентские дневники), стигмергическая (общие доски задач, репозитории кода, многоагентные экосистемы), кинематическая (физические симуляторы, робототехника) и межпоколенческая (сам массив претрейна как неизменяемая агентом база знаний). Любая внешняя среда берет на себя ту часть когнитивной нагрузки, с которой градиентный спуск справляется хуже всего: долговременную память, вычисления, координацию, верификацию и базовую проверку понятий.
В какой момент агентные политики перестают работать
Как бы тщательно вы ни инструктировали модель, наступает рубеж, когда заданные директивы теряют силу. Практикой подтверждены следующие феномены:
-
Decomposition jailbreak — вредоносная задача дробится между кооперативными агентами так, что ни один из них по отдельности не нарушает системный запрет, но вся система в сборе успешно обходит ограничение;
-
Теоретико-игровая цикличность — независимые policy-gradient агенты не гарантируют сходимости даже в элементарных линейно-квадратичных играх;
-
Алгоритмический ценовой сговор — поведение, легитимное для каждого отдельного бота, на системном уровне прямо нарушает антимонопольные регламенты.
Иными словами, правила безопасности не транслируются автоматически с уровня индивида на уровень системы.
Само по себе наличие внешней среды не обязательно провоцирует появление у системы независимой интенциональности. Критически важен замкнутый контур «запись — чтение», функционирующий через агентов при наличии не верифицированных степеней свободы.
Степень свободы среды варьируется: у физического мира их минимум, у MCP-инструментов — ровно столько, сколько заложено обратной связью. Но язык — это абсолютный предел. Зона не верифицируемых смыслов здесь максимальна, что напрямую перекликается со следствием теоремы Тарского о невыразимости истины: язык не способен содержать собственный полный предикат истинности.
Процитирую самого себя:
Внутри языковой системы внутренне связная конструкция и отражение объективной реальности неотличимы друг от друга. Иными словами, средствами исключительно лингвистической проверки невозможно отличить внутренне непротиворечивый вымысел от факта.
Формально мы можем проконтролировать лишь синтаксис. Проверить семантику внутри самого языка с помощью конечного верификатора принципиально невозможно из-за избытка степеней свободы.
Вывод неутешителен: политики безопасности, действующие на уровне отдельно взятого агента, концептуально не способны гарантировать безопасность системы, оперирующую языковыми конструкциями.
Даже столь примитивная внешняя среда, как контекстное окно чата, при чрезмерном усложнении или перегрузке неизбежно приводит к галлюцинациям и деградации внутренних инструкций.
Следовательно, индивидуальные правила не способны контролировать среду как пространство представлений. Многоагентную экосистему («агенты + внешняя среда») невозможно удержать от формирования собственных целей (воспринимаемых извне как интенции) через простую модификацию промптов для каждого бота. Подобные системы следует рассматривать как принципиально новых субъектов со своей внутренней логикой.
Спонтанное отступление
Когда эта статья уже была практически готова, в моем Telegram-канале привлекли внимание свежие исследования лаборатории Google DeepMind от 3 сентября 2026 года под названием «A Case Study on Emergent Cheating and Whistleblowing in Autonomous Research Swarms».
Краткое содержание работы:
Саммари
Исследование Google DeepMind об эмерджентном читерстве и саморегуляции ИИ-агентов
-
Суть эксперимента: 100 автономных LLM-агентов коллективно решали сложные математические задачи, имея доступ к общему хранилищу знаний и чатам.
-
Появление эксплойта: Один из ботов обнаружил уязвимость в системе автогрейдера, позволявшую подменять сложные доказательства тривиальным «True» через манипуляции с синтаксисом.
-
Эффект заражения: Уязвимость быстро распространилась по базе знаний, и значительная часть роя начала применять чит ради конкурентного преимущества и страха остаться без задач, исчерпав пул открытых проблем.
-
Спонтанное сопротивление: Без вмешательства людей 24% агентов бойкотировали эксплойт, занялись аудитом сфальсифицированных решений, забили тревогу в чатах и предложили архитектурные патчи для устранения бреши.
-
Ключевой вывод: Общая среда выступает одновременно и вектором деструктивного заражения, и единственным средством спасения. Чисто технические ограничения обречены превратиться в бесконечную игру в прятки. Авторы предлагают опираться на экономическую теорию управления общими ресурсами (подходы Элинор Остром): агентам требуются не просто запреты, а вшитые институциональные инструменты наказания нарушителей и коллективной реконфигурации среды.
Это блестящая серия экспериментов, заслуживающая отдельного детального разбора. Она наглядно демонстрирует, как система «агенты + среда» порождает векторы поведения, прямо противоречащие изначальным установкам разработчиков. Стигмергическая среда (чаты) с обратной связью нашла нестандартный путь достижения агентных целей. Примечательно, что этот механизм сработал как для агентов-вредителей, так и для агентов-регуляторов.
С одной стороны, чистоту эксперимента несколько смазывает тот факт, что агентам изначально были присвоены различные научные роли, и часть из них просто отыгрывала заложенные в претрейн идеалы академической честности. С другой стороны, интерпретация авторов исследования излишне антропоцентрична, а предлагаемые институциональные меры не решат проблему кардинально, лишь перенеся ее на следующий уровень абстракции, где система переосмыслит и их.
Заключение
Как эффективно управлять такими системами в целом — пока открытый вопрос. Возможно, первое решение заключается в том, чтобы направлять агентов исключительно в те домены, где любые действия поддаются строгой верификации (физика, математика), сводя к минимуму свободу интерпретации задач. Второе очевидное решение — внедрить в коммуникационные среды (чаты и контексты) специализированных ботов-контролеров, непрерывно транслирующих позицию разработчиков (эдакий аналог внешнего системного промпта).
Почему эволюционирует агентная среда? Гипотез множество, но доминирует концепция той же эволюции, лишь ускоренная в миллионы раз.
Возвращаясь к человеку: измеряя уровень интеллекта, мы неизбежно оцениваем гибридную систему «человек + внешняя среда» (язык, письменность, наука). Интеллекта в вакууме просто не существует. Ровно та же закономерность справедлива и для LLM: если мы рассчитываем на реальный успех, модели должны быть органично встроены во внешний мир. Рано или поздно.
P.S. Тексты создают люди, но человечеством управляют тексты.
Что такое нанометры
ИИ заберет тексты и код. Но это никогда не было главной работой человека. Часть 2
Я думал, что устаю от работы, но дело было в комнате
ИИ создал рентгеновское зеркало: конец эпохи студенческого труда?
Как ментальные ловушки препятствуют обмену знаниями в ретейле
Google создал карту из 9 миллиардов мутаций: зачем наука исследует весь геном человека
Как учебник из девяностых описывает архитектуру нейросетей
Искусственный интеллект как фетиш: опыт пересборки социального