Тест на AGI: приближает ли нас к нему победа над ARC-AGI-3?
Бенчмарки служат инструментом, с помощью которого специалисты могут оценивать собственные разработки, изучать достижения конкурентов и сопоставлять результаты. При этом у каждого теста своя конкретная задача.
Тест ARC-AGI-3 разработан фондом ARC Prize Foundation под руководством Франсуа Шолле для замера общего уровня интеллекта и способности искусственного интеллекта к обучению. Сложные интерактивные задачи в игровой форме изначально задумывались как барьер, преодолеть который под силу лишь ИИ, способному исследовать неизведанную среду, мгновенно улавливать логику, выстраивать стратегию и подстраиваться под меняющиеся реалии, то есть демонстрировать настоящий навык обучения.
Ряд команд уже отрапортовали о поколении этого бенчмарка на все 100%. Однако триумфом это назвать нельзя. В этой публикации я подробно объясняю, почему именно.
Что такое ARC-AGI-3
Тестирование ARC берет начало в 2019 году, когда моделям предлагалось работать с цветными сетками, опираясь всего на пару примеров. Шолле исходил из концепции, что для каждого кейса актуален свой собственный закон, отсутствующий в обучающей выборке. Иными словами, нейросеть должна выводить его «на лету». Сам автор описывал это как измерение результативности освоения умения, а не фиксацию самого навыка.
Первая версия, ARC-AGI-1, продержалась пять лет. Дебютные решения показывали скромные единицы процентов. Позднее в ход пошли алгоритмы перебора: специалисты формировали набор базовых манипуляций с сеткой и запускали банальный поиск комбинации, подходящей под условия. До определенного момента это приносило плоды, но из-за комбинаторного взрыва масштабировать подход оказалось невозможно. Прорыв наступил с появлением рассуждающих языковых моделей, преодолевших отметку в 70%.
В качестве ответа на это в 2025 году появился ARC-AGI-2, требовавший одновременного удержания контекста и применения нескольких правил. Нынешние LLM с этим вызовом не справились.
Актуальная итерация, ARC-AGI-3, кардинально изменила механику заданий, превратив их в интерактивные аркады в духе Atari. Если в статических задачах агент состязался преимущественно в вычислительной мощности перебора, то здесь правила и конечная цель скрыты — их приходится выяснять через непосредственные действия, причем система оценивает их суммарное количество.
Метрика RHAE базируется на двух параметрах: числе пройденных уровней и затраченных на это шагах. В роли эталона выступает среднестатистический человек, впервые севший за игру. Предполагалось, что интеллектуальный агент, действительно постигающий правила эмпирически, будет действовать экономно, тогда как слепой перебор потребует куда большего числа итераций.
Как нейросети справляются с бенчмарком
Для нейросетевых архитекტურ можно выделить три ключевых подхода:
Прямое взаимодействие. Среда передает модели текущий статус, а та выдает ответное движение. Никакой вспомогательной инфраструктуры, максимум рассуждения «на ходу». Результаты посредственны: модель теряет нить повествования, множит ошибки и выдает галлюцинации.
Обучение с подкреплением. Классический метод для ИИ, однако специфика самого бенчмарка физически не позволяет собрать необходимый массив обучающих данных.
Агентная обвязка. Модель функционирует в циклическом режиме, опираясь на системные промпты, оперативную память, файловую структуру и возможность исполнения кода. Именно этот путь продемонстрировал наивысшую эффективность.
Хочется подчеркнуть: бенчмарк, задуманный как проверка обучаемости, на практике оценивает качество инженерного окружения, созданного вокруг базовой нейросети.
Проект Сергея Родионова
В качестве хрестоматийного образца третьего подхода рассмотрим разработку Сергея Родионова, сотрудника SingularityNET со степенью PhD. Я ознакомился с его первым препринтом, прослушал доклад с новейшими результатами, а затем изучил вторую работу, где автор сам рефлексирует над собственным проектом.
Если обрисовать архитектуру крупными мазками: агент представляет собой модель Codex, наделенную доступом к среде Linux, файловой системе и интерпретатору Python. Алгоритмический модуль управляет игровым циклом и формирует запросы. Агент фиксирует состояние, формирует рабочую гипотезу об устройстве виртуального мира, совершает шаг, анализирует отклик и корректирует предположения.
В первой публикации автор заложил три фундаментальные идеи.
Исполняемая модель мира. Игровая механика теста максимально точно воссоздается внутри Python-скрипта.
Смещение к простоте. Периодически агент пытается подменять частные сценарии универсальными формулировками, реализуя практический аналог принципа минимальной длины описания.
Верификация через воспроизведение. От модели требуется буквальная воспроизводимость каждого зафиксированного наблюдения; при малейшем расхождении гипотеза аннулируется.
Мои первичные выводы после прочтения первого препринта сводились к следующему: формально правилам ARC-3 агент соответствует, но его духу — нет. Перед нами чисто инженерная конструкция, искусно подогнанная под конкретный тест. Работать она способна лишь в рамках примитивных, искусственно ограниченных вселенных, поскольку неизбежно упирается в те же преграды комбинаторного взрыва: трудности написания кода для чуть более сложных условий и поиск ответов внутри симуляции. Ключевой нюанс заключается в том, что задачи по-прежнему щелкаются перебором по схеме «генерация гипотезы — проверка — повтор цикла». Почему же в контексте бенчмарка это выглядит как прорыв? Потому что бремя верификации гипотез вынесено за пределы самого теста и возложено на связку LLM и Python-симулятора. Я озвучил это соображение на докладе и получил вполне резонный контраргумент: а кто сказал, что человек решает задачи как-то иначе? Пожалуй, здесь я соглашусь: если отбросить всю романтику озарений и интуитивных прорывов, то ни современная наука (что печально), ни философия (что ожидалось) не способны сказать нечто определенное о природе человеческого мышления.
Абляция
Прямо во время выступления Сергей Родионов преподнес сюрприз, представив вторую работу, посвященную тому, как каждый из трех китов системы влияет на конечный результат. В ней автор последовательно проводил абляцию — поочередно отключал компоненты и оценивал просадку показателей в бенчмарке.
Первый вывод: любая конфигурация демонстрирует прирост при переходе к более мощной языковой модели и углублении цепочки рассуждений. Прочие вариации оказались менее значимыми, а вклад изолированных компонентов выражен не столь ярко.
Выяснилось, что концепция исполняемой модели мира не оправдала возложенных ожиданий. Текстовый подход (задействующий лишь контекст LLM) превосходит симулятор в обеих модификациях топовой модели. На презентации Родионов подтвердил: отдельный симулятор избыточен, кодовому агенту вполне хватает стандартного контекста.
Python-симулятор, вынесенный в заглавие первой статьи, проиграл обычному текстовому анализу.
При этом полная верификация лидирует во всех четырех тестовых сценариях, хотя и требует колоссальных вычислительных затрат. Стремление к простоте помогает в трех случаях из четырех.
Иными словами, выделенная модель мира языковой модели оказалась не нужна. Реальную пользу приносит генерация идей (силами LLM), их селекция и последующее сжатие описаний.
Итоговый показатель на передовой модели приблизился к 99% RHAE, что наводит на две невеселые мысли:
-
Данный бенчмарк не занимается поиском общего искусственного интеллекта, иначе в роли AGI придется признать уже существующий ChatGPT.
-
Изыскания исследователей в этой плоскости с привлечением актуальных LLM лишены научной новинки и по сути сводятся к инженерному стресс-тестированию флагманских моделей.
Разумеется, сам Сергей придерживается иного мнения. Судя по докладу, создатели ARC-AGI-3 не стали официально засчитывать его результат, вероятно, разделив мое смутное ощущение утраты «духа AGI». Подобная позиция закономерно вызывает раздражение у инженеров: если у теста есть четкие количественные критерии, и модель их выполняет, она имеет право на победу; в противном случае стоит переписать правила либо закрыть проект.
Увы, авторы ARC-AGI-3 пока не готовы пойти ни на тот, ни на другой шаг.
Почему LLM одерживают верх
Умозаключение Сергея Родионова звучит следующим образом: кодовые агенты способны выступать универсальными решателями для детерминированных сред с эффективной низкой размерностью. Формулировка предельно аккуратная. Если это действительно так, то фронтир AGI должен сместиться в сторону способности действовать в условиях неопределенности и преобразовывать высокоразмерные пространства в пригодные внутренние модели.
Почему языковые модели так успешны в низкоразмерных мирах? На мой взгляд, здесь кроются две причины: одна лежит на поверхности, вторая носит более фундаментальный характер.
Причина первая: игры для ARC-AGI-3 создает узкая группа разработчиков, тогда как в тренировочных датасетах LLM зафиксированы десятилетия опыта десятков тысяч геймдизайнеров. Модели известны базовые табу, опасные объекты, ценные находки, типичная структура уровней и тысячи иных паттернов.
Фактически модель транслирует происходящее на мониторе в текстовый формат, отыскивает знакомые шаблоны из игровой индустрии, формирует гипотезы и проводит их валидацию. Пресловутый комбинаторный взрыв нейтрализуется не слепым поиском, а тем фактом, что пространство возможных гипотез уже заботливо заготовлено извне.
Крайне наивно полагать, что фантазия создателей ARC-AGI-3 превосходит воображение профессиональных разработчиков видеоигр.
Следовательно, секрет успеха кроется не в мгновенном озарении и выведении правил, а в распознавании заученного. LLM функционирует как интерактивное хранилище: она не решает задачу с нуля, а извлекает из памяти близкий аналог и тестирует его. Тот же перебор, но интеллектуальный. Стоит признать, что само по себе создание хранилища подобного масштаба и доступности — выдающееся достижение.
Причина вторая: вспомните концепцию Даниэля Канемана о Системе 1 (быстрое мышление) и Системе 2 (медленное мышление). Так вот, Система 2 физически не способна оперировать тем объемом информации, который перемалывает Система 1. Попытка загрузить в Систему 2 сопоставимый массив данных попросту обессмысливает ее существование. Именно поэтому отдельная Python-модель мира не принесла пользы в эксперименте Родионова. Система 2 должна оперировать абстракциями, но внятного ответа на вопрос, как именно абстрагировать внешний мир в детерминированной среде, пока не существует. Зато языковая модель справляется с этим элегантно благодаря своей архитектуре. Она описывает реальность языком, текстом. Пиксель, при контакте с которым игровой персонаж погибает, получает определение «охотник». И после этого LLM выдает каскад гипотез на базе усвоенных шаблонов: бежать, маскироваться, искать оружие… В человеческом понимании это не мышление, но для компактных искусственных миров этого оказывается вполне достаточно.
Выходит, что текстовое описание для языковой модели выступает той самой нативной формой абстракции, которая требуется для работы Системы 2. Именно поэтому текстовый подход оказывается результативнее филигранной симуляции игровой логики на Python.
Чего не способен измерить бенчмарк
Отсюда вырисовывается глубинная системная уязвимость ARC-AGI-3.
Метрика RHAE фиксирует лишь сухой итог — число покоренных уровней и затраченные действия. У теста отсутствует доступ к внутренней кухне алгоритма. Слепой перебор и подлинное осмысление выглядят абсолютно одинаково, если выдают идентичный вердикт в рамках заданных условий.
Штрафы за лишние шаги задумывались как предохранитель: перебор должен обходиться дорого, а озарение — дешево. Однако издержки каллибруются лишь внутри самой игры, тогда как манипуляции внутри симулятора остаются за кадром. Агент может бесконечно перебирать гипотезы в Python или в недрах контекста, а затем выдать верный ответ. Иными словами, грубые вычислительные мощности и скорость побеждают концептуальное понимание.
Это не баг и не лазейка, а прямая закономерность: бенчмарк оценивает исключительно конечный продукт модели, игнорируя механику поиска. Впрочем, предложить какую-то альтернативную методологию пока никто не в силах.
Фундаментальная проблема
Попробую пояснить, что именно я подразумеваю под настоящим мышлением. Возьмем элементарную задачу и компактную нейросеть.
Микромодель обучают распознавать, упорядочена ли последовательность чисел (скажем, длиной от 3 до 10 элементов). Обучение проходит блестяще, точность максимальная, но при подаче последовательностей длиной 14–20 элементов сеть начинает ошибаться. Не помогают ни индуктивные смещения, ни подключение второй аналогичной сети с иным диапазоном длин, ни четырехкратное увеличение числа параметров.
Стоит же скорректировать входные данные, добавив дельту (разницу между соседними элементами), как микросеть безошибочно справляется с задачей и легко масштабирует решение на любые новые длины.
Выходит, что решение существует, оно элементарно и заложено в данных, однако сама сеть его «не видит».
И это абсолютно логично. В системе координат нейросети — то есть в распределении обучающих данных — использование дельты менее выгодно: она требует больших вычислительных затрат при том же конечном результате. Сеть оптимизирует веса строго под текущее распределение. А требование «функционировать при любой длине» предъявляю модели исключительно я.
Я провел серию экспериментов: тренировал сети на сплошном диапазоне длин, задействовал зонды для восстановления дельты из скрытых состояний, замерял степень внимания на смещении в одну позицию. Итог: задача успешно решается на базовых длинах, за их пределами точность падает, а концепция дельты в представлениях так и не формируется.
Сеть отыскивает суррогатное решение, применимое лишь в границах обучающей выборки.
В ход шли расширение диапазона распределения, искусственное создание информационного бутылочного горлышка (bottleneck) для минимизации описания, запуск второй сети с иными границами и требование согласованности их внутренних представлений. Все эти меры срабатывали исключительно внутри тренировочного контура.
Иными словами, нейросеть принципиально неспособна самостоятельно изменить пространство переменных (интегрировать ту же дельту), хотя ее введение позволило бы радикально упростить алгоритм (сжав описание до минимума: если знак дельты неизменен по всей длине, значит, массив отсортирован; проверка автономизируется от общей длины, каждая позиция анализируется локально, а результаты суммируются). Единственный способ добиться этого — подать дельту извне в качестве исходных данных либо заложить такую архитектуру, в которой никакие другие признаки просто не могут возникнуть.
Первопричина
Механизм обратного распространения ошибки (бэкпроп) оптимизирует целевую функцию. Он концептуально не способен трансформировать пространство переменных: меняются лишь координаты в рамках той параметризации, которую инженеры задали изначально — через глубину слоев, специфику механизмов внимания или ограничения рецептивного поля.
Функция потерь (loss) сопоставляет поведение модели с заданным критерием. Но в процессе поиска принципиально нового представления сам критерий отсутствует. Бэкпроп не способен подсказать, какие именно новые переменные необходимо ввести для прорыва.
Чтобы добиться искомого, пространство представлений должно само стать объектом обучения и трансформации. Но чем оценивать эволюцию самого этого пространства, если целевая функция уже зафиксирована? Обратное распространение ошибки здесь бессильно. У меня есть сильное подозрение, что любые надстройки, функционирующие в парадигме бэкпропа, здесь не помогут.
Если кому-то удастся сконфигурировать нейросеть так, чтобы в задаче проверки сортировки она автономно вывела концепт дельты (или его эквивалент) без прямого или косвенного подсказывания, я с радостью удалю этот абзац.
Пока же ситуация выглядит следующим образом:
LLM осуществляет поиск решения в заранее очерченном пространстве представлений. AGI же должен заниматься поиском такого пространства представлений, в котором само решение становится тривиальным.
Интеллект в чистом виде — это способность находить форму представления данных, при которой целевое ожидание переходит в разряд достижимого.
Что может сработать
Если внутренние резервы системы исчерпаны, остается искать ответы во внешнем контуре.
Имеет смысл экспериментировать с обучением не на статичных распределениях, а на дрейфующих. Если условия задачи меняются быстрее, чем успевает закрепиться шаблон под текущий момент, суррогатные решения будут рушиться при каждом сдвиге, в то время как истинный инвариант устоит.
Иными словами, критерий истинности должен поступать извне.
Впрочем, нет сомнений, что для этого потребуется принципиально иной инструмент, свободный от ограничений бэкпропа.
Заключение
Изначально ARC-AGI-3 задумывался как маркер глубинного понимания, а не триумфа автоматического перебора. По факту же он фиксирует лишь то, насколько успешно кодовый агент, вооружившись чужими наработками, ориентируется в детерминированном низкоразмерном пространстве.
Разумеется, это упрек не в адрес создателей бенчмарка и не тех, кто его штурмует. Сергей Родионов проделал великолепную инженерную работу и не пытался маскировать ее слабые стороны.
Претензия носит более фундаментальный характер — она адресована самой идее измерять интеллект исключительно по результату. Бенчмарк не в состоянии провести грань между подлинным правилом и удачным суррогатом, поскольку водораздел проходит на глубине, недоступной для тестов. Более того, вероятность смоделировать задачу, свободную от паттернов, уже зафиксированных в мировом банке человеческих знаний, ничтожно мала. И здесь языковые модели обладают колоссальной форой.
LLM — это высокоэффективная интерактивная библиотека, умеющая извлекать из накопленного массива информации подходящие блоки для новых вводных, и делает она это все искуснее. Но они совершенно не умеют конструировать те пространства представлений, где решение задачи становится очевидным.
А подобное в принципе осуществимо, иначе наука о математике просто не появилась бы на свет. Комплексные числа, расчет орбит небесных тел, теория множеств — все это стало возможным лишь благодаря тому, что человечество изменило саму систему координат своего восприятия.
P.S. Не исключено, что поиск новых пространств удастся делегировать языковым моделям. Язык как гибкая символическая система способен описать любую абстракцию, включая то, чего никогда не было в обучающих выборках, даже в виде галлюцинаций. Однако станет ли это прорывом или просто породит очередную книгу для нашей «библиотеки» — покажет время.
Битва за код: Экспресс-история IT. Глава 0. Лейбниц, Бэббидж и Лавлейс
Стимпанк на двух колесах: как создавался первый в мире мотоцикл
Раскладка «ёлочкой» и план всей квартиры: как изменился калькулятор плитки за месяц
Развитие современного ИИ: какие задачи еще предстоит решить?
Статины или инъекции: современные методы борьбы с «плохим» холестерином
Битва с кодом: начало пути
Европа погрузилась в цифровую тьму