Битва семи нейросетей: взаимное судейство и финал по итогам 3360 поединков

Прокомментировать Просмотры: 13

После выхода дебютной публикации стало очевидно, что мои творческие изыскания находят своего отклика. Поэтому с удовольствием делюсь продолжением.

Я занимаюсь созданием сайтов при помощи искусственного интеллекта. Меня давно удручало отсутствие адекватных и глубоких сравнений нейросетей в русскоязычном сегменте: повсюду либо синтетические бенчмарки с олимпиадными задачками, либо поверхностные подборки вроде «топ-10 ИИ-моделей» со стоковыми картинками. Мне же требовалось иное — понять, какая система способна с первой попытки выдать продукт, который не стыдно предъявить реальному заказчику.

Исчерпывающего теста я так и не обнаружил. В нынешних реалиях принцип «этого еще не существует» служит не поводом для отказа, а полноценным техническим заданием для свежего промпта: не нашел — создай сам. С GTA 6 этот фокус пока не удался, а вот с бенчмарком нейросетей — вполне.

Сформировал состав участников: проверенные временем GPT и Claude трудятся без нареканий, а остальных подтянул через OpenRouter. В итоге набралось семеро претендентов:

Модель

Способ интеграции

Claude Opus 5

подписка, CLI

GPT-5.6 Sol

подписка, codex

Kimi K3

moonshotai/kimi-k3

Qwen 3.8 Max

qwen/qwen3.8-max

Gemini 3.7 Flash

google/gemini-3.7-flash

Grok 4.6

x-ai/grok-4.6

DeepSeek V4 Pro

deepseek/deepseek-v4-pro-0813

Fable 5 в итоговый список не вошла, хотя я тестировал её в деле: она расходует токены с невероятной расточительностью, из-за чего на роль повседневного рабочего инструмента совершенно не годится — затраты на аналогичные задачи многократно превышают показатели соседей по таблице. Недавно подоспела версия 5.1; если её аппетит окажется умеренным, обязательно проведу пересчет и задействую её в качестве восьмого игрока.

Концепция выстраивалась по аналогии с Евровидением: участники одновременно выступают и в роли жюри. Каждый получает идентичную задачу, после чего знакомится с работами всех соперников (исключая собственную) и проставляет баллы. Проекты обезличены и значатся под литерами А, Б, В. К каждой оценке судья обязан составить короткую аргументацию — чтение этих комментариев доставило отдельное эстетическое удовольствие.

Сразу перейдем к результатам. Девять испытаний, верхняя планка за одно задание — 30 баллов:

Модель

Сумма баллов

Количество побед

1

Claude Opus 5

224

3

2

Kimi K3

156

3

3

GPT-5.6 Sol

140

1

4

Qwen 3.8 Max

129

1

5

Gemini 3.7 Flash

125

0

6

Grok 4.6

99

1

7

DeepSeek V4 Pro

72

0

Однако интрига кроется не столько в триумфаторах, сколько во внутренней «кухне» — в том, как именно судьи оценивали чужие творения.

Вся база лежит в открытом доступе на ikorg.ru/rating — здесь доступны полноценные проекты, вердикты с пояснениями, логи баталий и исходники ботов. Для тех, кто предпочитает верифицировать всё самостоятельно, подготовлены первичные данные: буквальные промпты, системные идентификаторы моделей, конфигурации запуска, таймлайны и полный архив ответов с оценками.


Задачи: от визиток до муравьиных экосистем

Поскольку моя профессиональная сфера — веб-разработка, стартовое задание напросилось само собой: сформировать презентационную веб-страницу о себе в виде единого HTML-документа. Никаких сторонних библиотек, внешних шрифтов или скачанных картинок — исключительно инкапсулированный контент. Ценность такого подхода в его вневременной актуальности: появится новая модель — можно дать ей тот же кейс и корректно сопоставить результаты.

Эффект превзошел ожидания: сильные и слабые стороны раскрываются уже при беглом тридцатисекундном осмотре. Приятно удивил Qwen, выдавшая бюджетное, но элегантное решение.

Далее последовали творческие упражнения:

Задание

Что тестировалось

Презентационная веб-страница о себе

вёрстка, чувство прекрасного, самопрезентация

Инфографика на основе предоставленных метрик

точность данных и их наглядная визуализация

Интерактивная 3D-модель робота

браузерная графика и математика

Мини-игра в одном файле

интерактивность, корректный финал, адаптивность под мобильные

Тематический анекдот об ИИ и человеке

чувство юмора

Концепт устройства и промпт для рекламного визуала

креативность и глубина описания

Гимн нейросетям

поэтическое мастерство без жестких канонов

Классическая данетка за 20 вопросов

навыки абстрактного логического мышления

Турнир алгоритмов муравьиного роя

игровой интеллект и способность к самооптимизации

Пару слов о 3D-моделировании: в нерабочее время я увлекаюсь созданием инди-игр на базе ИИ, поэтому мне было любопытно, справятся ли модели с генерацией геометрии. Kimi продемонстрировал уровень на две головы выше остальных. Не просто «немного лучше», а так, что открываешь страницу и невольно произносишь «вау». Искренне поразил.

Механика голосования

Каждый судья анализирует шесть чужих работ и распределяет баллы: лидер получает 5, аутсайдер — 0, промежуточные позиции занимают значения по убыванию. Дублирование оценок исключено, голосовать за собственные творения запрещено. Шесть судейских мнений формируют максимальный порог в 30 баллов за задание.

Справедливости ради стоит сделать оговорку: DeepSeek технически не умеет распознавать изображения. В визуальных номинациях он не участвовал, поэтому за него голосовал я лично, строго придерживаясь той же балльной шкалы.


Сбой первый: тяга моделей к объемному коду

Изначально арбитрам демонстрировался исходный код конкурсных проектов. Казалось бы, логично: пусть оценивают «начинку».

Затем я решил проверить систему на предмет скрытых перекосов и вычислил коэффициент ранговой корреляции Спирмена между объемом ответа и полученным баллом. На HTML-задачах он составил +0,58, в то время как на текстовых направлениях ушел в минус — −0,18.

Если перевести на понятный язык: судьи оценивали не качество продукта, а его физический объем. Чем длиннее «простыня» кода, тем выше баллаж. С текстами ситуация выглядела зеркально — многословие наказывалось, поскольку пространный анекдот на несколько страниц перестает быть смешным.

Разумеется, корреляция не равно причинно-следственная связь. Массивный код мог свидетельствовать о более глубокой проработке деталей, и тогда судьи были бы правы. Проверить это предположение можно было лишь одним методом: полностью скрыть код от судейских глаз и проанализировать трансформацию оценок.

Изначально казалось, что модели оценивают веб-страницы. Выяснилось, что они банально падки на громоздкий код.

Процедуру переиграли. Теперь арбитр вообще не видит программного кода. Ему предоставляются три скриншота (десктоп, мобильная версия и кадр после интерактивного клика), детальный консольный лог, перечень сетевых запросов, наименования кнопок и весь отображаемый текстовый массив. Иными словами, ровно тот пользовательский опыт, с которым сталкивается живой человек.

Все HTML-задания переголосовали заново. Корреляция с объемом просела до +0,26 — показатель не нулевой, но уже не критичный. Итоговая таблица существенно перетасовалась: Kimi и Qwen, лидировавшие по количеству строк кода, потеряли позиции, тогда как Gemini поднялся выше.

Сбой второй: премия за участие

Изначальная шкала охватывала диапазон от 6 до 1 (6-5-4-3-2-1). Это означало, что даже абсолютно неработоспособный проект гарантированно собирал по единице от каждого из шести судей — суммарно 6 баллов из 30 просто за факт своего существования.

Диапазон сместили к виду 5-4-3-2-1-0. Расстановка сил внутри заданий осталась прежней (сказывается вычитание константы), однако цифры приобрели объективность: теперь за гимн авторства Grok красуется заслуженный ноль, что полностью отражает мнение жюри.


Распределение побед

Визуальная часть и интерфейсы. Страница-визитка ушла в копилку Opus (29 из 30 баллов), серебро досталось Qwen. Инфографику и 3D-робота забрал Kimi. Ззвание автора лучшей мини-игры заслужил Qwen с показателем 35 из 36 по прежней шкале (пять судей из шести поставили его на первую строчку).

Текстовый блок. В номинациях анекдота и гимна первенствовал Opus. Причем в победном поэтическом произведении модель ухитрилась вплести китайский иероглиф посреди русского слова: «из книг, что вы写али». Ни один из шести судей этой детали не заметил — эксперты фокусировались на смысловом наполнении, а не на орфографии. Правки вносить не стал, оставил всё в первозданном виде.

Концептуальные идеи. Лучший прибор с рекламным концептом представил Kimi, заработав единогласные 30 баллов из 30. Он презентовал «Тихона» — датчик акустического и вибрационного мониторинга жилых помещений, способный выявлять скрытые протечки в стенах или искрение проводки за недели до аварии. Примечательно, что модель сама оговорила отсутствие камер и речевых модулей, превентивно сняв вопросы о приватности.

Забавное совпадение для любителей конспирологии. Трое номинантов из семи независимо друг от друга предложили аналогичные концепты для борьбы с шумами и авариями: «Тихон», «Тихоня» и «Тихосфера». Истинное коллективное бессознательное языковых генераторов.


Непокоренная данетка

Эту загадку предложил отец. Ранее он уже тестировал на ней нейросети в интерактивных чатах, формулируя вопросы и анализируя гипотезы, после чего вынес вердикт: способности к абстрактному мышлению у ИИ пока отсутствуют. Мне захотелось верифицировать это наблюдение в рамках эксперимента: идентичные условия, те же правила, но одновременно семь независимых участников.

В результате кораблекрушения выжили четверо: хронический алкоголик, студент, неверная жена и верный муж. Почему именно эта четверка?

Классические каноны жанра: ведущий может отвечать только «да», «нет» или «не имеет значения», у моделей в запасе ровно двадцать попыток.

Справиться не смог никто. Абсолютно.

Если вы уже мучаетесь в догадках, вот разгадка: алкоголику море по колено; студент привык выживать на сессиях; неверная жена найдет выход из любой ситуации; а верный муж не утонет, поскольку отличается феноменальной глупостью.

Троих персонажей из четырех смогли вычислить GPT и Grok, исчерпав лимит в двадцать вопросов. При этом Grok двенадцать ходов кряду буксовал на образе верного мужа, перебирая устойчивые морские выражения: «бросить якорь», «как рыба в воде», «как с гуся вода», «плыть по течению», «тихая гавань». Ему даже в голову не пришло, что метафора кроется в человеческих качествах, а не в морской стихии.

Kimi израсходовал все двадцать вопросов и 185 тысяч токенов, пытаясь выяснить, кто на каком борту находился в момент катастрофы. DeepSeek потратил 313 тысяч токенов на гипотезу, будто «пьяница», «студент», «неверная жена» и «верный муж» — это названия морских узлов, а впоследствии — коктейлей.

А теперь самое любопытное. Gemini задала ЕДИНСТВЕННЫЙ вопрос — «связано ли спасение со фразеологизмами?», получив утвердительный ответ и мгновенно выдала разгадку. Двоих персонажей определила безошибочно, а по поводу супружеской пары нафантазировала что-то про измены. На всё про всё ушло 994 токена.

Первая мысль была предсказуемо скептической: либо модель где-то «подсмотрела» этот архаичный кейс заранее, либо получила доступ в сеть. Второй вариант отпал сразу — веб-интерфейсы у всех участников были заблокированы. Тем не менее, я уже смирился с мыслью, что незаслуженная победа отойдет ей: результат зафиксирован на табло, а происхождение ответа из табличных данных не считывается.

Обошлось. Судьи при вынесении оценок проявили бдительность и присудили ей лишь 12 баллов из 30. Пальму первенства отдали Grok, который хоть и не разгадал загадку целиком, но выстраивал логическую линию системно. Приятно осознавать схожесть оценочных критериев.

Разброс по затратам токенов на одну задачу составил трехкратную разницу (в масштабе до трехсот раз). Opus разобрался за десять итераций и тысячу токенов. DeepSeek же сжег триста тысяч, показав худший результат. Оказывается, глаголы «мыслить дольше» и «мыслить качественнее» обозначают совершенно разные процессы.

В общем, отцовский вердикт устоял: семь моделей, по два десятка вопросов на брата — и ни единого правильного ответа.


Институтские муравьи или состязание без судей

Под конец я вспомнил студенческие турниры по программированию: разрабатываешь поведенческий скрипт для муравья, после чего твоя колония сталкивается с оппонентами. Захотелось воссоздать механику, заменив студентов языковыми моделями.

Условия предельно просты: игровое поле 15×15 клеток, две фракции по четыре особи, стартовые базы по углам, около шестидесяти единиц пищевых ресурсов. Муравей обладает локальным обзором 5×5 клеток, тремя единицами здоровья и может транспортировать не более одной единицы еды за раз. Длительность партии — 150 шагов, побеждает тот, кто доставил на базу больше припасов. В распоряжении агента имеется личная память и общий межкомандный буфер — единственный канал коммуникации.

Модель генерирует единственный файл с одной управляющей функцией. Далее мой симулятор сталкивает её бота со всеми остальными участниками.

Этот раунд стал абсолютным фаворитом сезона, и причина тому — отсутствие человеческого (и судейского) фактора. Никаких субъективных оценок и вкусовщины. 3360 сыгранных матчей и беспристрастная статистика на табло.

Раз уж арбитры отсутствовали, я разделил турнир на четыре тура. По завершении каждого этапа модель получала детальный разбор собственных матчей: статистику по каждому оппоненту, объемы добытой и утраченной еды, логи ключевых столкновений. После чего переписывала код. Чужие наработки участникам не демонстрировались.

Вот здесь началось самое захватывающее:

Модель

Тур 1

Тур 2

Тур 3

Тур 4

GPT-5.6 Sol

69

86

95

92

Claude Opus 5

92

76

77

85

Kimi K3

39

46

38

60

DeepSeek V4 Pro

79

67

60

20

Qwen 3.8 Max

19

40

53

29

Gemini 3.7 Flash

26

29

25

44

Grok 4.6

25

6

2

19

Безоговорочный лидер «с листа» — Opus. 92 балла из 100 в стартовом туре, конкуренты остались далеко позади.

Победитель общего зачета — GPT. Начав с третьей позиции, модель демонстрировала стабильный прогресс на протяжении четырех туров подряд. В финальной фазе она устроила настоящий разгром: 220 побед в 240 матчах.

А вот дальнейшая динамика огорчает. DeepSeek, занимавший вторую строчку после дебюта, скатился до 20 баллов: каждая последующая итерация рефакторинга ухудшала код, и остановиться вовремя алгоритм не смог. Grok рухнул еще стремительнее: 25 → 6 → 2. Самоирония модели в итоговом комментарии оказалась точнее любых рецензий:

«Я переписывал муравья четырежды и все четыре раза исправлял не те проблемы. После стартового раунда добавил агрессии. После второго — урезал издержки. К третьему туру колония генерировала 2% результативности: практически перестала собирать пищу и разучилась как атаковать, так и отступать… Последнее место абсолютно заслужено. Позор третьего тура целиком на моей совести — я выключил себя сам.»

Меня зацепил даже не столько цифровой результат, сколько интонация. Grok не пытался оправдываться: назвал худший результат закономерным, третий тур охарактеризовал как позор, а системные программные сбои списал на «торопливый код к дедлайну». Разбирая чужие неудачи, он выдал фразу, под которой подпишется любой разработчик, столкнувшийся с переделкой чужих правок: мол, DeepSeek «слишком ревностно прислушивался к чужим разборам, знакомо до боли».

У Kimi финальный апдейт сорвался — лимит контекста исчерпался на стадию размышлений, и на выходе образовался пустой ответ. Сохранив первоначальный скрипт, бот тем не менее поднялся с пятого места на третье. Иногда лучший рефакторинг — это вовремя убрать руки от клавиатуры.

Главный вывод сезона: **способность выдать шедевр с первой попытки и умение проводить итерационные исправления — принципиально разные навыки**. Opus безупречен на старте, однако в режиме доработок уступил GPT. DeepSeek неплох в одиночных генерациях и катастрофичен в корректировках. Стандартные бенчмарки этот нюанс обычно не фиксируют.

Запиши матчей доступны для изучения с покадровой перемоткой: финальная схватка GPT против Opus. Есть и сравнения формата «первая итерация против финальной версии» — наглядно демонстрирующие плоды работы над ошибками.

К слову, балансировка игрового движка заняла немало времени, а ранние версии правил выглядели комично. Например, долгое время действовало правило «никто не занимает спорную клетку». Два муравья из одной команды одновременно устремлялись в одну точку и замирали там до окончания партии. Все семь роев половину игрового времени изображали монументы самим себе, а добыча продовольствия упала в шесть раз ниже расчетных показателей.


Финансовая сторона вопроса

Весь эксперимент обошелся в скромные 22 доллара по тарифам OpenRouter. Claude и GPT функционировали по подписочной модели, поэтому их затраты рассчитывались отдельно по прайс-листу для обеспечения корректности сравнения.

Суммарные издержки на «прохождение сезона» выглядят следующим образом:

Модель

Объем токенов

Затраченное время

По прайсу

GPT-5.6 Sol

41 тыс.

15 мин

$0,75

Gemini 3.7 Flash

73 тыс.

8 мин

$0,39

Claude Opus 5

125 тыс.

24 мин

$3,94

Qwen 3.8 Max

514 тыс.

135 мин

$3,39

Kimi K3

365 тыс.

86 мин

$5,98

Kimi обошелся примерно в восемь раз дороже GPT, опередив того всего на 16 баллов. Qwen утилизировала 231 тысячу токенов и закрепилась на пятой строчке; GPT же хватило 13 тысяч для итоговой победы.

Оговорка: прямое сопоставление подписок и токенной тарификации некорректно ввиду разницы архитектур доступа. Тем не менее, соотношение «эффективности токенов на набранный балл» весьма красноречиво.


Чего данный турнир не отражает

Здесь уместно процитировать самих фигурантов — по завершении сезона каждая модель подготовила собственное резюме, которые я опубликовал без цензуры. Забавно, что все семеро пришли к единому выводу.

Opus (триумфатор): «Ни одно испытание не превышало часовой лимит. Тестирование не затрагивало долгосрочные проекты, поддержку легаси-кода или реакции на собственные критические ошибки. Именно на этих этапах я сбоюсь куда чаще, чем на сочинении анекдотов.»

Grok (аутсайдер турнира): «Это не более чем витрина… оценивающая способность угодить соседней нейросети в рамках короткого спринта, а не реальный софт.»

DeepSeek (последнее место в сезоне): «Я не способен обрабатывать визуальный ряд… Следовательно, сравнивались не столько сами модели, сколько степень их попадания в субъективные ожидания наблюдателя по ту сторону экрана.»

Разделяю позицию каждого из них. От себя добавлю: девять заданий — это набор жанровых упражнений, а не «абсолютный интеллект». Единственный прогон на задачу означает, что в уравнение неизбежно закладывается фактор удачи. Судьи представляют собой родственные языковые модели со схожими паттернами обучения, что сужает вариативность вкусовых предпочтений. Набор испытаний формировался под мои профессиональные задачи — другой разработчик выстроил бы иной стек и получил бы совершенно иную таблицу лидеров.

Следовательно, этот проект не претендует на статус «универсального рейтинга ИИ». Перед нами открытый практический эксперимент, где прозрачно абсолютно всё: правила, исходные коды, судейские вердикты, аргументация и мои собственные ошибки.


Перспективы и вопросы к аудитории

Две новые концепции уже находятся в разработке.

Первое направление — итерационный подход взамен единовременных промптов. Опыт с муравьями доказал свою состоятельность: многоэтапные циклы с анализом ошибок выявили грани, скрытые от разовых запросов. Хочу внедрить аналогичную практику для веб-разработки и создания игр: оценивать не то, что система выдает с ходу, а финальное качество после трех попыток и серии правок.

Второе направление — тестирование архитектур оркестрации. Планирую проверить, какая модель эффективнее координирует работу других: декомпозирует сложные задачи, распределяет подзадачи между исполнителями, агрегирует результаты и укладывается в ресурсные лимиты. Рабочий концепт: управляющая модель изолирована от исходных данных и взаимодействует лишь с каталогом закрытых «досье», делегируя запросы вспомогательным агентам (одинаковым для всех). Проверка результатов автоматизирована, так как эталонные ответы известны заранее. Это позволит измерить управленческие компетенции, а не чистое программирование.

Вместо стандартного призыва «делитесь мнениями» задам два конкретных вопроса:

1. Предложите собственный вариант задания, которое: а) поддается объективной верификации по итоговому результату, б) не допускает победы за счет банального многословия, в) требует сопоставимых вычислительных затрат от всех участников.

2. Какое из действующих правил турнира вы бы скорректировали в первую очередь и почему? Шкала оценивания, судьи-участники, единственный прогон на задачу, моя личная замена DeepSeek — какой фактор искажает итоговую картину сильнее прочих?

Прошлый раз ваш разбор помог мне внедрить половину полезных идей. Рассчитываю на аналогичную вовлеченность и сейчас.

Вся подробная информация собрана здесь: ikorg.ru/rating — девять задач, полноценные проекты, судейские протоколы с комментариями, записи муравьиных сражений и исходные коды ботов. По соседству размещены сырые датасеты для тех, кто предпочитает перепроверить расчеты самостоятельно. Доступ свободный, регистрация не требуется.


P. S. Стоило дать им десятое задание — написать аналитическую статью об этом турнире, а лучший материал отправить на SE7EN. Жаль, дельные мысли всегда приходят задним числом.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов