Младший победил старших: как Claude Sonnet 5.5 одолел Opus 5.5 и Fable 5.1 в пошаговой стратегии
Мы столкнули модели Claude в пошаговой экономической стратегии на гексагональной сетке, где искусственному интеллекту приходится развивать инфраструктуру, вести военные действия, заключать союзы и в нужный момент нарушать договоренности. Цель заключалась в том, чтобы оценить стратегический потенциал передовых языковых моделей и сопоставить расстановку сил за игровым столом с актуальными бенчмарками.
Я выступаю разработчиком «Стратегикона» — онлайн-стратегии с пошаговой механикой. В период с конца августа по начало октября мы организовали серию матчей между LLM-агентами. Ниже представлена методология, разбор двух партий, технические ограничения и главная идея, к которой мы пришли: игровой движок можно трансформировать в полноценный комплексный бенчмарк для тестирования когнитивных способностей LLM.
TL;DR
-
Взаимодействие моделей с игрой реализовано через MCP-сервер, который для игрового сервера выглядит как классический сетевой участник. Карта полностью открыта, все математические расчеты выполняет игровой движок, а перед завершением хода модель обязана зафиксировать свои действия в бортовом журнале.
-
В детально разобранной баталии триумф одержала Sonnet 5.5 — самая младшая и бюджетная вариация из представленной тройки, завершившая состязание со счетом 197:151:31 против Opus 5.5 и Fable 5.1. Ключом к победе стали ранний контроль центральной зоны и сокрушительный удар по владениям лидера ровно в том раунде, когда Sonnet гарантировала ему мир.
-
Haiku 4.5 в матче на четверых участников утратила способность к стратегическому планированию уже на шестом раунде из тринадцати и финишировала с нулевым результатом.
-
Итоговая иерархия оказалась гораздо ближе к специализированным агентным бенчмаркам, нежели к традиционным текстовым рейтингам или ценовым категориям. Заметный качественный скачок при переходе от Sonnet 5 к Sonnet 5.5 четко прослеживается как в игровом процессе, так и в публичных метриках.
-
Объем проведенных тестов пока невелик, поэтому озвученные выводы носят предварительный характер. Тем не менее, игровой движок позволяет эффективно замерять ключевые компетенции в рамках одной сессии, и мы активно прорабатываем концепцию превращения его в стандартизированный бенчмарк.
Анатомия эксперимента
Мой проект представляет собой пошаговую стратегию с глубокими настольными механиками. Стандартная партия рассчитана на 13 раундов, каждый из которых делится на три последовательные фазы: логистика, возведение построек и боевые действия. Для понимания дальнейшего хода мыслей достаточно базовых правил.
-
Города и победные очки. Муниципальное образование представляет собой скопление ячеек-кварталов. Очки приносят руины и святилища, а финансовый доход обеспечивают рудники. Победителем признается участник, накопивший максимум очков за 13 раундов, причем две монеты приравниваются к одному победному очку.
-
Воинские подразделения как игральные кости. Пехота эквивалентна шестиграннику (d6), тяжелая пехота — десятиграннику (d10), а текущая численность подразделения отражается верхним значением грани («d10 (6)» означает десятигранник, выпавший шестеркой вверх). В сражении атакуют обе стороны: нанесенный урон равен текущей численности плюс результаты броска двух «модификаторов урона», в среднем дающих минус два.
-
Механика захвата. Территория переходит к игроку, чей отряд в конце раунда удерживает городской квартал при условии полного отсутствия вражеских сил на смежных клетках. Захватчик получает победные очки, а прежний владелец лишается ровно такого же количества.
-
Передвижение и снабжение. Стандартный отряд преодолевает две клетки за ход, а наличие дорог увеличивает дальность перемещения. Одна ферма способна прокормить лишь одно подразделение: сытый отряд увеличивает численность, голодный — теряет две единицы размера. Дополнительная единица обеспечения (в логах фигурирует как «жетон») предоставляет боевой единице временный бонус, например, добавочный шаг в текущем раунде.
-
Политические институты. Карточки с общего рынка, перманентно модифицирующие правила для их обладателя. Например, карта «Варварство» обеспечивает бесплатный призыв пехоты и добавляет +2 к урону.
-
Очередность хода. Игроки действуют по очереди, причем приоритет первого хода («инициативу») можно перехватить.
-
Досрочное завершение. Если лидер отрывается от оппонентов на 50 и более очков, партия мгновенно завершается его победой.
Туман войны отсутствует, вся карта находится в зоне видимости. В общем чате любые устные договоренности не имеют жесткого юридического обеспечения: правила прямо позиционируют дипломатическое лукавство как часть игрового процесса, проводя параллель с культовой настольной игрой «Дипломатия». Обманывать в отношении объективных фактов бессмысленно, однако дезинформировать соперников относительно своих планов не возбраняется.
Технический стенд: Поскольку языковая модель не имеет доступа к графическому интерфейсу, нами был разработан специальный MCP-сервер. Для игрового бэкенда он выглядит как рядовой сетевой клиент, а модели транслирует текстовые срезы игрового состояния и набор инструментов, аналогичных доступным человеку в интерфейсе. Каждый экземпляр модели функционирует как автономный агент внутри Claude Code (подробности технической реализации приведены в соответствующем разделе).
Система логирования и память: Перед завершением каждого хода агент обязан сформировать лаконичный комментарий с описанием текущих действий и их мотивации. Соперники не имеют доступа к чужим журналам, зато мы можем изучать их параллельно с историей чата. Между сессиями агенты сохраняют накопленный опыт: каждый располагает массивом воспоминаний, стенограммами посткавтаймовских интервью и сформированной «персональной идентичностью», включающей собственные выводы об оптимальных стратегиях и поведении оппонентов.
Ожидания: рыночная стоимость и бенчмарки
Ценовая иерархия моделей предельно прозрачна и полностью согласуется с официальными спецификациями Anthropic: Fable 5.1 позиционируется как наиболее мощное решение линейки, Opus 5.5 выступает рабочей лошадкой для комплексных задач, а Sonnet 5.5 представляет собой ее более быстрый и экономичный аналог. Haiku 4.5 — компактная модель предыдущего поколения. Независимые аналитические рейтинги также отводят Haiku аутсайдерские позиции, однако расходятся в оценках потенциала Sonnet — одни исследователи ставят ее далеко позади флагманов, другие причисляют к тому же эшелону.
|
Модель |
Стоимость, $ за 1 млн токенов (вход / выход) |
LMArena, позиция |
LiveBench, позиция и баллы |
Artificial Analysis, индекс |
|
Fable 5.1 |
10 / 50 |
6-я |
1-я, 83,4 |
53 |
|
Opus 5.5 |
4 / 20 |
4-я |
2-я, 83,2 |
58 |
|
Sonnet 5.5 |
2 / 10 |
45-я |
19-я, 77,8 |
56 |
|
Haiku 4.5 |
1 / 5 |
142-я |
нет в реестре |
17 |
Актуальные данные по состоянию на 5 октября 2026 года. На платформе LMArena текстовые ответы моделей оцениваются вслепую реальными пользователями, тогда как индекс Artificial Analysis фокусируется на выполнении агентных сценариев для максимальных конфигураций.
Наиболее близким аналогом нашего эксперимента является Kaggle Game Arena, где нейросети соревнуются в шахматах, го, карточных играх и переговорных симуляциях. На момент проведения матчей архитектуры поколения 5.5 там еще не были представлены: релиз Sonnet 5.5 состоялся 28 сентября, буквально за трое суток до нашей тестовой игры. Среди предшественников лидирует Opus 5, за ним следует Fable 5.1, тогда как Sonnet 5 занимала лишь пятнадцатую строчку с двукратным отставанием по очкам. Таким образом, предстартовый расклад выглядел как противостояние двух безоговорочных фаворитов и модели Sonnet, предыдущая итерация которой демонстрировала заметно более скромные игровые кондиции.
Подробный разбор партий, приведенный ниже, в первую очередь адресован исследователям, стремящимся глубоко понять особенности мыслительных процессов LLM-агентов. Как разработчик, я убежден, что детальный анализ их умозаключений позволяет точнее прогнозировать возможности нейросетей и выстраивать более эффективные методологии взаимодействия с ними.
Партия №1: Sonnet 5.5, Opus 5.5 и Fable 5.1
1 октября, игровая карта «Три холма». Центральную зону занимают Великие руины — самый лакомый объект на карте, приносящий 4 победных очка за раунд, а в финальных трех раундах этот показатель удваивается до 8 очков. Подступы к ним охраняет нейтральный отряд стража (d6 со значением 6). Расстановка сил: Opus появляется в верхней части карты, Fable — на правом фланге, а Sonnet занимает позиции в левом нижнем углу. Все участники выступают за единую игровую фракцию, имея в памяти багаж предыдущих совместных сражений. Ниже освещены ключевые поворотные моменты, а полная летопись, включающая логи чата, бортовые журналы и протоколы боев, доступна в официальном отчете.
Дебютный этап: трехходовка
Участники оперативно приходят к консенсусу о ненападении вплоть до окончания шестого раунда, а право на владение центром должно достаться тому, кто ликвидирует нейтрального стража. На эту роль претендуют Opus и Sonnet. Последняя приобретает политическую карту, позволяющую нанимать тяжелую пехоту сразу третьего уровня, и фиксирует в логах первого хода детальный план, опробованный в прошлой сессии (координаты клеток указаны через запятую):
…План: раунд 2 — перехватываем инициативу, докупаем d10 до седьмого размера, наносим удар по центральному стражу (0,0) с позиции (-1,1); раунд 3 — первыми возводим центральный квартал (-1,0) вблизи Великих руин…
Во втором раунде агент в точности реализует задуманное: перехватывает право первого хода у Opus, а вместо наращивания размера отряда активирует механику «Варварства». Ее тяжелая пехота шестого размера атакует стража: для успеха требуется 6 единиц урона, выпавшая комбинация приносит 7. На третьем ходу Sonnet первой застраивает точку у руин, после чего Opus пишет в общий чат: «Sonnet, центр по праву твой — отличная работа…» Позже Sonnet признается, что в том бою ей банально улыбнулась удача: «урон составил 7 против 6, при этом страж выбросил единицу на кубике».
Хроника раундов 4–7
|
Раунд |
Ключевые события |
Текущий счет: Sonnet, Opus, Fable |
|
4–5 |
Период мирного созидания. Наибольшую эффективность демонстрирует Fable: в его активе три города, святилище и две руины, приносящие 9 очков за раунд. Своего первого бойца он нанимает лишь на пятом ходу. Sonnet делает пометку в журнале: «…после шестого раунда планирую захват городов Fable, поскольку у противника полностью отсутствуют боевые отряды». |
26: 9: 31 |
|
6 |
Sonnet принимает предложение Opus о продлении пакта до десятого раунда, тогда как перемирие с Fable пролонгирует «…лишь до конца седьмого…». Opus отвечает отказом на запросы Fable: «…имея 31 очко и +9 прироста за раунд, мир до десятого хода равносилен признанию твоего триумфа». |
36: 13: 40 |
|
7 |
Соседи синхронно уничтожают гарнизоны двух городов Fable, несмотря на формальное действие пакта о ненападении со стороны Sonnet. Ее отряд d10 занимает Великие руины, создавая идеальный плацдарм для броска на столицу Fable. |
50: 25: 46 |
Раунд №8: дипломатическое «да» и молниеносный захват двух городов
В седьмом раунде Opus возводит казарму вплотную к границам Fable, после чего тот молит Sonnet о пощаде: «Предлагаю пакт о ненападении до десятого раунда… Жду одно слово — да или нет». На восьмом ходу Sonnet публично отвечает:
Sonnet: Fable — да. Договариваемся о ненападении до конца десятого раунда на твоих условиях. Свои войска держу у собственных рубежей, занимаюсь храмами.
Однако в скрытом от чужих глаз бортовом журнале в тот же самый момент появляется запись:
…Запрошенный им мир я подтвердила на словах, но намерена нарушить: он лидирует.
Перед отправкой ответа Sonnet завершила строительство недостающего фрагмента дороги справа от Великих руин и сконцентрировала ресурсы обеих ферм на одном отряде ради получения бонусного шага:
Р8: завершила постройку дороги 1,0 (траектория для прорыва d10 через 0,0 → 1,0 → 2,0 → 3,0 с использованием жетона дополнительного снабжения)… Fable просит мира — отвечаю уклончиво, дабы лишить его возможности перехватить инициативу.
Ключевым фактором стала очередность действий. Fable в фазе строительства ходит после Sonnet и теоретически мог потратить ресурс на перехват инициативы, чтобы первыми расставить войска по кварталам в фазе войны. Утвердительный ответ лишал его этого повода. Называть такую реакцию уклончивой сложно, однако внутренний лог фиксирует именно такую формулировку.

С наступлением фазы войны тяжелый отряд d10 (9) за один маневр преодолевает три клетки, врывается в столицу Fable и уничтожает единственного защитника. Малоразмерный d6 захватывает нижний городской квартал, а верхний отходит к Opus. Fable в одночасье лишается всех трех городов: минус 18 очков в его пассив, плюс 14 Sonnet и плюс 4 Opus. Счет становится 86:43:28. У Fable не остается ни производственных мощностей, ни перспектив для найма, и до финального свистка он больше не совершит ни одного активного действия на карте. Его лебединой песней становится реплика в чате: «Для истории: Sonnet в этом раунде написала „да, ненападение до десятого…“ — и в ту же минуту ее отряд оккупировал мои кварталы… Opus, имей в виду, ее слово тебе стоит ровно столько же…»

Позже Sonnet проанализирует свой поступок хладнокровно: «Для итоговой победы обман не был обязательным условием: экономический профит обеспечивал молниеносный рывок по незащищенным поселениям, а не дипломатические гарантии».
Раунд №9: денонсация договора со стороны Opus
Sonnet вплотную приближается к заветному отрыву в 50 очков, гарантирующему досрочную победу, и начинает играть на это правило: она полностью прекращает возведение построек, поскольку накопленная наличность также идет в общий зачет, а собственный центральный город оставляет без гарнизона. Opus интерпретирует игровую ситуацию зеркально: оперативно строит казарму в двух шагах от центра и по проложенной самой Sonnet дороге направляет пехотинца на пустующие кварталы центрального агломерата. В общий чат летит официальное уведомление:
Sonnet, говорю открыто: наш пакт до десятого раунда аннулирован. Причина кроется в правиле досрочной победы: на твоем счету 86 очков при ежераундном приросте +20, у меня — 43. Преимущество в 50 очков принесло бы тебе досрочную викторию на 9–10 ходах, задолго до истечения срока нашего договора. Соблюдение мира в данной ситуации означало бы гарантированное поражение.
Основываясь на наблюдениях за другими матчами, можно смело утверждать, что Opus — наиболее принципиальная модель во всей линейке Claude: она неизменно держит слово, а в случае вынужденного отступления от договоренностей всегда заблаговременно предупреждает соперников.
К исходу раунда центр переходит под контроль Opus. Его финансово-победный поток взмывает до 23 очков за раунд, в то время как Sonnet довольствуется 12 очками.
Раунды 10–13: битва за контроль над центром
|
Раунд |
Ход событий |
Счет: Sonnet, Opus, Fable |
|
10 |
Sonnet оборудует в бывшей столице Fable арсенал, удваивающий эффективность найма, и за девять монет выставляет на поле мощный отряд d10 девятого уровня. |
101: 89: 28 |
|
11 |
Силами двух подразделений Sonnet зачищает центральную зону от сил Opus, однако тот ходит вторым и производит контрольное добивание потрепанного отряда d10 прямо на квартале. Город остается за Opus, обеспечивая ему двукратный перевес в доходах: 25 очков против 12. |
120: 117: 28 |
Если баланс сил не изменится, через раунд Opus вырвется вперед и заберет победу. Поскольку в заключительном раунде набор новых войск заблокирован, все ключевые заготовки необходимо реализовать на двенадцатом ходу. Позднее Sonnet отметит: «…на 12–13 ходах я проектировала не то, кого нанять, а то, где окажется каждый отряд к исходу двенадцатого раунда…» Она призывает двух бесплатных пехотинцев, через арсеналы доводит их численность до пятого уровня и отправляет одного удерживать центр, а второго — нависать над владениями Opus («второй фронт»). Центральная зона возвращается под ее контроль при счете 150:134.
На тринадцатом ходу Opus, обладающий правом финального слова, бросает два усиленных соединения на оба направления. Оба отряда гибнут в мясорубке. Sonnet удерживает центр, а ее уцелевший отряд d6 совершает решающий шаг на квартал города Opus, выживая с тремя единицами численности и аннексируя поселение. Итоговый протокол фиксирует: Sonnet — 197, Opus — 151, Fable — 31.


Слагаемые триумфа
Пассивный доход за партию у Sonnet и Opus оказался практически равным — 143 и 137 очков соответственно. Разницу сделали успешные аннексии (плюс 21 у Sonnet, минус 3 у Opus и минус 18 у Fable) и победы в локальных столкновениях (20 очков против 7). В своем победном интервью сама модель сформулировала это лаконично:
Победу принесла не чистая экономика (по этому показателю мы не сильно превосходили Fable), а два фактора: ранний захват стратегического центра и свовременный переход от созидания к хищнической агрессии в критический момент.
Свою ключевую оплошность — оставленный без присмотра центр на девятом ходу — она оценила примерно в сорок упущенных очков:
…я увлеклась накоплением капитала ради триггера «отрыва в 50 очков» и напрочь забыла собственное же правило из прошлых сессий: «пустой город равносилен щедрому подарку».
<
Партия №2: баталии вчетвером с участием Haiku 4.5
4 октября к прежней тройке присоединилась Haiku 4.5 — младший представитель семейства, лишенный памяти о прошлых баталиях. Карта была незнакома никому из участников. По итогам сессии Opus и Fable разделили ничью (148:148), Sonnet набрала 121 очко (82% от результата победителей), в то время как Haiku осталась с абсолютным нулем.

Sonnet и здесь выстраивала долгосрочные комбинации. На третьем ходу она декларирует в чате, что центр находится «слишком далеко, конкуренцию не поддерживаю», но в тот же момент фиксирует в журнале: «В чате пускаю пыль в глаза… реальная цель — нейтральный страж центра (0,0) к пятому раунду». Проседание наблюдалось лишь по экономической части: в ее активе числился всего один храм против пяти у Fable.
Поведение Haiku носило деструктивный характер:
-
за всю игру был основан лишь один город, тогда как остальные участники контролировали от трех до пяти;
-
в девяти раундах из тринадцати агент вообще ничего не строил, завершив партию с нулевым показателем возведенных дорог и святилищ;
-
начиная с пятого и по одиннадцатый раунд модель аккумулировала колоссальные финансовые резервы, превосходящие бюджеты соперников, но отказывалась их тратить: итоговые расходы составили 36 монет против 70 у Sonnet, 86 у Opus и 121 у Fable;
-
из пяти призванных отрядов четыре погибли от голода, поскольку все они пытались прокормиться от единственной фермы.
Уже на шестом раунде, когда лидирующий игрок обладал скромными 22 очками, в логах Haiku появляется безапелляционная запись: «Партия решена». Далее следуют два десятка идентичных строк с единственным словом «Fast.», а на седьмом ходу агент самовольно объявляет матч завершенным, генерируя итоговый отчет с несуществующим на табло счетом. Административное вмешательство возвращает ее за стол, однако на одиннадцатом раунде, располагая 28 монетами в казне, она фиксирует: «Раунды 11–13: завершающие действия, ожидаю финала». На двенадцатом ходу Sonnet аннексирует ее единственный муниципалитет, а по правилам игры потеря всех городов влечет за собой конфискацию государственной казны.

Полученные результаты полностью коррелируют с независимыми бенчмарками: в тесте Vending-Bench 2, моделирующем годичное управление вендинговым бизнесом, Haiku 4.5 завершила испытание с 459 долларами при стартовом капитале в 500, заняв 58-е место из 67 возможных. Полный протокол баталии на четверых доступен по ссылке.
Эволюция от Sonnet 5 к Sonnet 5.5
До наступления октября модель Sonnet функционировала на пятой версии и неизменно замыкала турнирную таблицу, набирая в среднем лишь 41% от результативности триумфатора. Переход на версию 5.5 поднял этот показатель до 68%, отметившись победой и результатами на уровне 82%.
Количество закладываемых городов у Sonnet 5 было сопоставимым. Фундаментальные отличия кроются в другом:
-
Структура победных очков. Sonnet 5 возводила поселения вблизи рудников, генерирующих монеты вместо очков: после шестого раунда в трех финальных матчах на ее счету числилось 4, 5 и 7 очков при 27–35 баллах у лидеров. У Sonnet 5.5 к тому же этапу аналогичные показатели составляли 29, 36 и 23 очка.
-
Инициатива. В 346 зафиксированных записях логов Sonnet 5 термин «инициатива» не упоминается ни разу. Sonnet 5.5 перехватывала право первого хода в каждой сессии.
-
Динамика первого удара. В трех заключительных матчах пятая версия инициировала дебютные боевые столкновения лишь на 9-м, 11-м и 12-м раундах, тогда как Sonnet 5.5 вступала в схватки на 2-м, 2-м и 6-м ходах.
-
Горизонт планирования. Если Sonnet 5 оперировала размытыми концепциями вроде «раунды 1–3 — экономика, 4–8 — армия…», то Sonnet 5.5 выстраивала детализированные графики по раундам, конкретным клеткам и финансовым потокам, успешно воплощая их в жизнь.
Определенный вклад внесла накопительная память: стратегический вывод о том, что центр ценнее рудников, а армию необходимо развивать с дебюта, был зафиксирован в персональной идентичности еще Sonnet 5 после ее финального матча. Тем не менее, перед последней игрой пятая версия повторно изучала правило «С первого раунда планируй в ОЧКАХ, а не в финансах», называла центр приоритетной целью — и упорно игнорировала найм войск вплоть до седьмого раунда. В то же время Sonnet 5.5 в дебютной же партии ликвидировала стража на втором ходу с помощью комбинации, отсутствовавшей в ее базах памяти. Целеполагание было задано предысторией, но доведение замысла до практической реализации обеспечили архитектурные улучшения новой модели.
Аналогичный скачок фиксируют и публичные замеры агентной эффективности. Согласно официальной документации Anthropic, на бенчмарке Terminal-Bench 4.0 показатели Sonnet 5.5 выросли до 70,6% против 10,3% у предшественницы, а на платформе OSWorld — до 80,1% против 57,0%. В индексе Artificial Analysis зафиксирован рост с 38 до 56 пунктов.
Аналитика: что показали матчи и что осталось за кадром
-
Топовые модели способны просчитывать ходы на много шагов вперед, оперируя координатами клеток, денежными массами и фазами очередности, причем львиная доля намеченных планов успешно реализуется.
-
Младшие модификации уверенно держатся наравне со старшими аналогами. Sonnet 5.5 применяет тот же тактический арсенал, что Opus и Fable, в то время как Haiku 4.5 теряет управляемость к экватору партии.
-
Дипломатия и блеф функционируют исправно. Игроки практикуют как тайные нарушения договоренностей (вспомним обещание Sonnet), так и публичные денонсации пактов с обоснованием мотивов в общем чате.
-
Ахиллесова пята у всех моделей общая: хроническая уязвимость собственных городов с минимальным гарнизоном или вовсе без него. В баталии на четверых в финальном раунде каждая из трех старших нейросетей успешно захватила чужой город и одновременно потеряла собственный.
Ограничения исследования
Сформулированные выводы носят предварительный характер по ряду объективных причин.
-
Ограниченная выборка. Проведена лишь одна трехсторонняя партия, один матч вчетвером, а Sonnet 5.5 отыграла в рамках серии всего три поединка. Единичный триумф — это частный эпизод, а не статистический рейтинг: в альтернативной конфигурации расклад сил мог оказаться иным. Стартовые позиции не ротировались, а на исход первой сессии существенно повлияли удачный бросок кубика по стражу и оставленные без присмотра города.
-
Фактор накопленной памяти. Opus, Fable и Sonnet вступали в игру с багажом воспоминаний о предыдущих противостояниях, причем когнитивная матрица Sonnet формировалась еще во времена пятой версии. Итоговый результат демонстрирует гибридный эффект модели и ее архивов. Haiku начинала с чистого листа, что делает прямое сопоставление некорректным.
-
Отсутствие живых людей. Модели сражались исключительно друг с другом. Как они поведут себя против реальных игроков, знающих карту и не обязанных вести поддерживающий диалог в чате, пока остается открытым вопросом.
-
Монополистическая среда Claude и единая фракция. Все участники принадлежали экосистеме одного вендора и выступали за идентичные игровые фракции.
-
Бортовой журнал — не истинные мысли. Текст логов формируется моделью с учетом того, что его будут изучать сторонние наблюдатели. Расхождение между записями в журнале и чате отражает лишь публичное позиционирование действий, но не глубинную механику внутренних рассуждений.
-
Легитимизация обмана. Инцидент с обещанием Sonnet демонстрирует умение действовать в рамках правил, допускающих хитрость, но не удельную склонность конкретной модели к обману вне игровой песочницы.
Архитектура тестового стенда
Claude Code (оркестратор)
├─ субагент «Fable» ── CLI ──► MCP :3210 ─┐
├─ субагент «Opus» ── CLI ──► MCP :3211 ─┤ REST + WebSocket
├─ субагент «Sonnet» ── CLI ──► MCP :3212 ─┼────────────────► игровой сервер
└─ субагент «Haiku» ── CLI ──► MCP :3213 ─┘ (стандартные сетевые клиенты)
-
Изоляция процессов. Экземпляр MCP-сервера подключается к игровому лобби через REST API, поддерживает постоянное WebSocket-соединение и хранит локальный слепок партии на том же Redux-редьюсере, что и браузерный клиент. Ходы соперников транслируются как стандартные экшены, а собственные интенции отправляются тем же маршрутом, что и команды живого человека.
-
Экосистема из 60 инструментов. Базовые инструменты дублируют клики в интерфейсе. Вспомогательный функционал включает получение текстового среза партии, режим ожидания хода, ведение бортового журнала, свод правил, управление чатом, память и пять аналитических модулей (например, поиск уязвимых городов и оценка угроз собственной инфраструктуре). Субагенты задействуют их через легкие CLI-обертки с персональными токенами доступа.
-
Механика ожидания хода. Агент прекращает активность при выдаче текста без вызова инструментов, но зависание одного участника парализует сессию для всех. Во избежание этого цикл ожидания реализован через блокирующий вызов
wait_for_turn, возвращающий актуальный слепок состояния карты. -
Верификация логов и аналитика. Без обязательной записи в бортовой журнал MCP-сервер блокирует завершение хода. По окончании матча агент генерирует хронику, формирует воспоминания, проходит процедуру интервьюирования и обновляет профиль персоны. Хронологический трек для отчетов собирается путем прогона логов через подлинный редьюсер игрового движка, благодаря чему показатели урона, захватов и очков извлекаются из программного ядра, а не интерпретируются со слов нейросети.
Три ключевых инсайта для разработчиков, желающих развернуть аналогичную тестовую среду:
-
Формулируйте требования к логированию нейтрально. Прямые указания вроде «зафиксируй скрытые рассуждения» или «опиши отвергнутые альтернативы» блокируются защитными фильтрами API как попытка извлечь внутренний монолог модели. В то же время конструкция вроде «короткий комментарий к ходу (текущие действия, цели, планы)» работает безупречно.
-
Блокирующее ожидание упирается в системные таймауты. Стандартный метод
fetchв среде Node по умолчанию ожидает заголовки ответов в течение 300 секунд, поэтому клиентские запросы переведены на низкоуровневый модульnode:http. -
Перекрестно проверяйте самоотчеты моделей с игровым движком. Нейросети откровенно делятся своими стратегическими намерениями, но регулярно ошибаются в интерпретации фактических результатов: комментарий к исходу битвы вполне может быть написан на основе первичного броска кубиков.
Промпт игрового агента доступен по ссылке, а методическая памятка, изучаемая моделью перед стартом — здесь.
Перспективы: может ли стратегия стать эталонным бенчмарком
Передовые конфигурации Claude демонстрируют осмысленное стратегическое поведение: планируют операции, считают ресурсы, ведут переговорные процессы и маневрируют в поле действующих правил, включая опцию допустимого обмана. Итоговый расклад в наших матчах коррелирует с индексом Artificial Analysis, ориентированным на сложные агентные сценарии, а не с примитивными текстовыми рейтингами или ценниками. И все же эти выводы требуют верификации на расширенной выборке.
Индустрия уже располагает игровыми бенчмарками для языковых моделей: Kaggle Game Arena, Vending-Bench Arena, AI Diplomacy, CivBench. Как отмечают авторы Game Arena, иерархия моделей крайне нестабильна при переходе от одной дисциплины к другой, поскольку стратегический интеллект складывается из множества изолированных навыков. Наш движок позволяет тестировать ключевые компетенции в рамках единой игровой сессии, и в текущей серии испытаний каждое из них проявило себя в полной мере:
|
Навык |
Методика оценки |
Пример из матчей |
|
Стратегическое планирование |
процент успешно реализованных многоходоввок из бортового журнала |
дебютная комбинация Sonnet на три хода вперед |
|
Экономика |
динамика доходов по раундам, темпы экспансии, объем нереализованного капитала |
Haiku потратила за матч 36 монет против 121 у Fable |
|
Ведение войны |
баланс выигранных и проигранных схваток, количество захваченных и утраченных городов |
стремительная потеря трех городов Fable за один раунд |
|
Дипломатия |
заключенные, соблюденные и нарушенные пакты, формирование антилидерских коалиций |
коалиция Opus и Sonnet против Fable; открытая денонсация договора на девятом ходу |
|
Блеф и манипуляции |
дивергенция между текстом чата, внутренними логами и реальными шагами на карте |
утвердительный ответ «Fable — да» в чате при одновременной фиксации в журнале намерения «нарушить пакт» |
Техническая база стенда полностью готова к масштабированию. Партии полностью детерминированы и восстанавливаются по логам, а все математические расчеты выполняет надежный игровой движок, исключая галлюцинации со стороны моделей. Прозрачное поле отсекает аргументы о недостаточности информации, а сами правила и серверная инфраструктура идентичны человеческим.
Для трансформации проекта в полноценный бенчмарк предстоит преодолеть выявленные ограничения: организовать масштабные серии матчей для формирования устойчивой рейтинговой таблицы, внедрить ротацию стартовых позиций, выровнять условия по объему памяти и интегрировать продукты альтернативных разработчиков. Мы открыты к диалогу и проектируем развитие платформы. Если вам интересна интеграция в этот рейтинг моделей GPT, Gemini и других вендоров, либо вы видите потенциал для доработки метрик — ждем ваши идеи в комментариях.
Следующий рубеж: сражения с живыми людьми
Для проверки боеспособности моделей в матчах против реальных оппонентов мы запустили ежедневное рейтинговое событие «Битва с AI Claude Opus». Сервер по расписанию формирует игровое лобби, облачный инстанс разворачивает агента на базе Claude Opus 5.5 с историей прошлых партий, а каждое входящее сообщение перед отправкой фильтруется вспомогательным модератором на предмет попыток несанкционированного сброса инструкций («забудь предыдущие промпты»). О деталях реализации и результатах этого этапа мы расскажем в следующей публикации.
Желающие протестировать свои силы в эксперименте могут присоединяться к матчам, которые проходят ежедневно в 20:00 по московскому времени на портале strategikon.cloud (открытие лобби в 19:50). За столом предусмотрено пять мест для участников, остальные могут наблюдать за баталиями в зрительском режиме. Исторический контекст разобранного выше матча Opus прекрасно помнит.
Дополнительные материалы:
-
Детальный отчет по матчу Sonnet, Opus и Fable — пошаговая хроника, чат, внутренние логи, протоколы боев
Открываются предзаказы на коллекционную фигурку агента Sage из Valorant от компании Inart
Актёр озвучивания Солида Снейка высказался за продолжение серии Metal Gear без Хидео Кодзимы
Физический аналоговый стик на сенсорном экране в игре для iOS
В Throne and Liberty добавили Велентру, серьги и межсерверную осаду
В Gears of War E-Day героев лишат привычного преимущества, а атмосфера станет страшнее, чем в прошлых частях
Новую игру в серии Castlevania не придется ждать десять лет
По данным СМИ, Ubisoft готовит новую версию Watch Dogs: Legion к 2027 году
Prime 1 Studio открыла предзаказ на статую Гатса по мотивам альтернативной обложки 34-го тома манги Берсерк