ARC-AGI-2: обучающая и тестовая выборки принадлежат разным распределениям

Прокомментировать Просмотры: 5

Обучающая и валидационная выборки ARC-AGI-2 принадлежат к разным распределениям

Оценивая эффективность своего алгоритма на случайной выборке из обучающего набора (train), вы неизбежно получаете смещенные результаты. Медианная задача из train генерирует матрицу из 100 ячеек, тогда как для eval этот показатель составляет 225. Необходимость предсказать два и более тестовых примера возникает лишь в 6,9% задач обучающей выборки против 40,8% в валидационной. Данное расхождение стабильно проявляется по всем шести исследованным структурным параметрам и сохраняет статистическую значимость даже после внесения поправок на множественные сравнения.

Ниже представлен детальный сравнительный анализ распределений обоих открытых датасетов ARC-AGI-2, контрольные суммы исходных файлов, а также сбалансированное по структуре подмножество train, максимально приближенное к eval. Ссылка на CSV-файл с перечнем задач приведена в конце статьи.

Существенное уточнение, подробно разобранное ниже: данная работа сфокусирована исключительно на структурных характеристиках, а не на субъективной сложности для человека. Попытка валидировать сформированный индекс сложности на результатах тестирования людей показала его несостоятельность.

1. Контекст и предшествующие исследования

Речь не идет о скрытой проблеме: расхождение между наборами данных открыто зафиксировано авторами бенчмарка в официальной документации.

В руководстве к ARC Prize прямо указано:

the public training set consists of simpler tasks whereas the public evaluation set is roughly the same level of difficulty as the private test set

Иными словами, открытый train содержит базовые задачи, тогда как открытый eval по уровню сопоставим с закрытым тестовым сетом. В спецификации ARC-AGI-2 обучающий набор помечен как Uncalibrated, в то время как три оценочных набора обозначены как Calibrated.

Количественные сопоставления выборок уже проводились ранее, но лишь для первой версии бенчмарка. В исследовании H-ARC (arXiv:2409.01374), где агрегированы решения 1393 участников по 800 задачам ARC-AGI-1, отмечается:

An independent samples t-test confirmed that output grid size (number of grid cells) is significantly larger on average in the evaluation set (M = 235.1, SD = 246.7) than in the training set (M = 136.2, SD = 164.9), t(798) = 6.81, p < .001

Там же зафиксирована разница в решаемости задач человеком: 76,2% успешных попыток на train против 64,2% на eval.

Запрос на создание калиброванного подмножества также не нов. Ронан Киллиан Макговерн (arXiv:2511.02886, раздел 4.7) подчеркивал:

it would have been highly useful to have an ARC AGI II training split of 120 tasks in the same distribution as the public eval and semi-private eval set

В русскоязычном сегменте ARC освещался фрагментарно. В 2020 году Татьяна Шаврина приводила агрегированные структурные метрики из исходной статьи Франсуа Шолле без разбиения по сплитам, а Никита Зелинский тогда же разбирал эвристические подходы к поиску решений. Полноценного анализа распределений для ARC-AGI-2 до сих пор не публиковалось.

Ключевая новизна данного материала: исследование формы распределений (вместо поверхностных средних значений) на актуальной версии ARC-AGI-2 (1000 против 120 задач), добавление двух неописанных ранее метрик и публикация готового оптимизированного подмножества. Если подобные расчеты уже где-то публиковались — поделитесь ссылкой в комментариях, я дополню текст.

2. Структура задачи ARC-AGI-2

Каждое задание представляет собой набор демонстрационных пар «входной образ — целевой образ» и одну либо несколько тестовых матриц, для которых требуется восстановить трансформацию. Максимальный размер поля ограничен 30×30 ячейками при палитре до 10 цветов. В публичном доступе находятся два сплита: обучающий (1000 задач) и валидационный (120 задач).

Принципиальный методологический момент: демонстрационные пары содержат эталонные ответы в обоих открытых файлах, тогда как решения для тестов вынесены в закрытую часть. Все последующие расчеты базируются исключительно на демонстрационных примерах. Закрытые данные не затрагивались, поэтому риск утечки данных (data contamination) полностью исключен.

3. Данные и алгоритм расчета

Репозиторий проекта динамичен. Так, в мае 2025 года в наборе eval прошла серия правок, удалившая первый тестовый индекс у ряда заданий, что делает снимки данных до и после неидентичными. Для воспроизводимости фиксируем контрольные суммы:

arc-agi_training_challenges.json
  sha256 779eaba89790ebad9af02514a7efc0aefaf2cf8236f046a31bbf8b9ec48f20f5
  4 010 050 байт, 1000 задач

arc-agi_evaluation_challenges.json
  sha256 e7c62a4bd211867c6b538f66b8013b81f299663c82ca062f49a52bf439d6e4e8
  984 679 байт, 120 задач

Для каждого задания извлекались 6 параметров исключительно на основе демонстрационных примеров:

  • геометрическая площадь входа и выхода (произведение медианной высоты на медианную ширину среди демонстраций задачи);

  • число уникальных цветов во входных и выходных матрицах (медианное значение по демонстрациям);

  • количество демонстрационных пар в условии;

  • количество тестовых примеров, требующих решения.

Важно подчеркнуть нюанс с вычислением площади: произведение медианных сторон не эквивалентно медиане площадей отдельных примеров. Эти метрики расходятся в 23,5% случаев для train и в 35,0% для eval. В данном исследовании применяется первый вариант; логика полностью прозрачна в репозитории проекта.

4. Сдвиг распределений: эмпирические свидетельства

Ограничиваться сравнением средних величин некорректно — они нивелируют особенности формы распределений. Ниже представлены кумулятивные функции распределения по каждому признаку и статистика Колмогорова — Смирнова (KS), отражающая максимальную дистанцию между кривыми.

Признак

Медиана train

Медиана eval

Статистика KS

p-value (Манн — Уитни)

Тестовых входов

1

1

0.339

3.95e-30

Площадь входа

114

324

0.436

6.26e-24

Площадь выхода

100

225

0.384

4.82e-17

Цветов на входе

3

5

0.331

7.30e-14

Цветов на выходе

3

4

0.276

5.14e-09

Демонстраций

3

3

0.125

2.83e-03

Анализ шести признаков требует коррекции на множественную проверку гипотез. По методу Холма при пороге α = 0,05 статистическая значимость подтверждается для всех шести осей (скорректированное p-value для числа демонстраций составляет 2,83e-03).

Необходима методологическая ремарка: p-value в таблице получено с помощью критерия Манна — Уитни, тогда как статистика KS служит мерой величины эффекта. Это различные тесты, и на наименее контрастной оси их выводы расходятся. При объемах выборок n=1000 и 120 критический порог KS на уровне 0,05 составляет 0,131. Фактическое значение для числа демонстраций (0,125) не позволяет критерию Колмогорова — Смирнова отвергнуть нулевую гипотезу (p = 6,33e-02). Однако по оставшимся пяти признакам оба теста единогласно фиксируют колоссальный разрыв.

Примечательно и другое: если по пяти метрикам eval превосходит train по масштабу, то по количеству демонстраций картина обратная — в среднем 2,98 против 3,23. Задачи из eval более громоздкие и богатые по палитре, но содержат меньше обучающих примеров.

Особо показательна первая строка таблицы: медианы числа тестовых входов идентичны (равны 1). Сравнение точечных оценок показало бы полное отсутствие разницы, тогда как расхождение скрыто в самой форме распределения. Именно поэтому распределительный анализ здесь незаменим.

5. Природа структурного расхождения

Два фактора требуют отдельного рассмотрения, поскольку ранее они практически не исследовались.

Первый — количество тестовых примеров на задачу. Здесь зафиксирован наибольший статистический разрыв (p = 3,95e-30).

Тестовых входов

train

eval

1

931

71

2

63

46

3

5

3

4

1

0

Два и более тестовых таргета содержат лишь 6,9% задач из train против 40,8% задач в eval (критерий хи-квадрат = 127,3; p = 1,59e-29).

Это влечет за собой фундаментальные последствия для оценки моделей: задача засчитывается как решенная только при 100% правильных ответов для всех тестовых матриц. Солвер, оптимизированный под train, в 93% случаев решает изолированные кейсы, тогда как на валидации почти половина задач требует мультигенерации. Итоговый скор падает из-за эффекта совместной вероятности, даже если логическое правило задачи элементарно.

Второй аспект — входные размерности. Большинство работ анализируют размер целевой сетки, однако по входным параметрам расхождение выражено сильнее (статистика KS: 0,436 против 0,384). Медианная площадь входа в eval (324 ячейки) почти втрое превышает train (114 ячеек).

Это смещает вектор проблемы: алгоритмам сложнее не столько сгенерировать ответ, сколько обработать и извлечь паттерны из существенно большего объема входных данных.

6. Формирование калиброванного подмножества

Логичный шаг при таком дисбалансе — собрать из train сбалансированную подвыборку, структурно консистентную с eval, для адекватной локальной валидации.

Примененный алгоритм: нормализация признаков по статистикам train и последующий выбор ближайшего соседа в признаковом пространстве для каждого объекта из eval (без возвращения).

Здесь важно избежать методологической ошибки: оптимизация по целевым метрикам тривиально гарантирует сближение распределений по этим же метрикам. Демонстрация сходства по признакам подбора не несет доказательной силы.

Чтобы исключить самосбывающийся результат, процедура была разделена:

  1. Подбор выполнялся исключительно по 3 признакам: площадь выхода, цветовая палитра выхода, число демонстраций.

  2. Выборка eval делилась пополам: 60 задач использовались для поиска соседей, а оставшиеся 60 изолировались в контрольную группу.

  3. Оценка качества согласования производилась на контрольной группе eval и по трем параметрам, не участвовавшим в алгоритме оптимизации (площадь входа, цвета входа, количество тестовых входов).

Результаты валидации:

Признак

KS (случайный train)

KS (сбалансированный)

Участие в оптимизации

Площадь выхода

0.362

0.150

Да

Цветов на выходе

0.284

0.083

Да

Демонстраций

0.159

0.083

Да

Площадь входа

0.459

0.167

Нет (контроль)

Цветов на входе

0.348

0.200

Нет (контроль)

Тестовых входов

0.248

0.217

Нет (контроль)

Первые три строки ожидаемо демонстрируют сходимость. Главный результат — в нижних строках: оптимизация выходных параметров автоматически подтянула согласованность входных признаков. Это свидетельствует о системной сопряженности метрик и доказывает, что отобранный сплит действительно генерализует структуру eval.

Существенное ограничение: метрика количества тестовых входов практически не поддалась косвенной калибровке (KS 0,248 против 0,217). Структура демонстраций не связана с числом тестовых кейсов. Если данный фактор критичен для вашей модели, его необходимо закладывать в функцию отбора напрямую.

Дополнительно оценивался базовый шумовой порог: не является ли сближение следствием малой выборки (N=60)? На основе 2000 случайных сэмплов аналогичного объема медианное значение KS по площади выхода составило 0,367 (5-й перцентиль — 0,283). Калиброванный сплит показал 0,150 — ни одна случайная генерация не приблизилась к этому значению.

7. Проверка индекса сложности на результатах людей

Необходимое опровержение первоначальной гипотезы.

Полученные данные подталкивают к попытке свести структурные параметры в единый скалярный «индекс сложности» и объявить eval объективно более сложным. В черновом варианте исследования такой индекс был сформирован, однако его сопоставление с эмпирическими данными решения задач людьми (датасет H-ARC) показало полную несостоятельность концепта.

Метрика не коррелирует с успешностью прохождения тестов человеком, а для одного из базовых признаков направление зависимости оказалось противоположным интуитивным ожиданиям.

Верификация данного блока продолжается: метрики H-ARC пока заимствованы из текста публикации и требуют автономного пересчета на сырых данных перед обнародованием точных коэффициентов.

Главный вывод: формулировка «eval сложнее» некорректна. Наборы структурно разнородны, что строго доказано. Насколько эта специфика затрудняет работу конкретного алгоритмического солвера — открытый вопрос, не сводимый к геометрии сеток.

8. Границы применимости результатов

Резюме ключевых ограничений исследования:

  • Выводы не распространяются на закрытый тестовый сплит: анализировались только открытые JSON-файлы.

  • Структура не детерминирует решаемость: геометрические свойства слабо связаны с абстрактной трудностью алгоритма.

  • Работа не содержит обвинений в адрес авторов: специфика датасетов задокументирована создателями.

  • Калиброванный сплит не повышает скор автоматически: он лишь делает оценку на локальной валидации репрезентативной.

  • Метрики фиксируют форму и цвет, но не семантику преобразований: компактная сетка может скрывать крайне изощренную логику.

  • Алгоритм отбора оперирует тремя признаками из шести и практически не устраняет сдвиг по числу тестовых входов.

  • Объем выборки eval скромный (120 задач), что расширяет доверительные интервалы оценок.

  • Анализ привязан к конкретной ревизии файлов (хэши зафиксированы), а бенчмарк продолжает эволюционировать.

9. Алгоритм адаптации для произвольных данных

Описанный пайплайн применим к любым ML-задачам, где train и eval формировались асинхронно или по разным протоколам:

  1. Сформируйте вектор неразмеченных структурных признаков объекта: размерности, разнообразие элементов, компонентность, плотность информации.

  2. Проанализируйте форму распределений признаков (через KS-тест или аналоги), избегая опоры на простые средние значения.

  3. Примените поправку на множественное тестирование (например, метод Холма) во избежание ложноположительных находок.

  4. При наличии сдвига сформируйте сбалансированный сплит методом подбора и обязательно протестируйте его на отложенной выборке и не задействованных в оптимизации признаках.

Наибольшее число методологических ошибок совершается именно на этапе валидации подбора (шаг 4).

10. Материалы и воспроизводимость

  • CSV-таблица с оптимизированным подмножеством: ID задач обучающего набора и их векторные признаки.

  • Исходный код для воспроизведения всех статистических вычислений, расчета хэшей и оценки шумового порога.

Если вы обнаружили неточность в приведенных математических выкладках — напишите об этом в комментариях; текст будет скорректирован с указанием автора правки.

 

Источник

Поделиться:

Похожие статьи

Поиск по играм, новостям и статьям…

Введите не менее двух символов

Введите не менее двух символов