ARC появился 5 ноября 2019 года в препринте Франсуа Шолле On the Measure of Intelligence. Публичный спор вокруг него резко усилился 20 декабря 2024 года после поста ARC Prize о результатах превью o3 на ARC-AGI-1, а 17 мая 2025 года вышел препринт ARC-AGI-2, где авторы уже прямо описали ограничения первой версии теста.
Из-за названия легко решить, что ARC-AGI — это почти готовый «экзамен на AGI». Но если читать первоисточник, претензия у теста уже: он пытается измерять, насколько система умеет быстро приобретать новый навык на незнакомой задаче, когда ей дали мало опыта и почти не разрешили опираться на внешние знания. Ниже — разбор именно этой, более узкой, но технически содержательной идеи.
Коротко
- ARC-AGI не является общепринятым тестом на AGI: само понятие AGI остаётся спорным, и универсального теста для него нет.
- По Шолле, ARC/ARC-AGI задуман как приближение к измерению skill-acquisition efficiency — эффективности освоения нового навыка на незнакомой задаче.
- Дизайн теста специально убирает язык и специализированные факты о мире, оставляя лишь «core knowledge» вроде объектов, счёта, симметрии и базовой геометрии.
- Высокий балл на ARC-AGI нельзя автоматически читать как «достигнуто AGI»: результат зависит не только от абстракции, но и от search-процедур, test-time adaptation и вычислительного бюджета.
- Появление ARC-AGI-2 в 2025 году важно само по себе: авторы признали, что первая версия давала искажённый сигнал из-за утечек, малого скрытого набора и уязвимости к brute-force/search-стратегиям.
Контекст
Начать стоит с базовой оговорки: термин AGI не имеет общепринятого точного определения. Это прямо отмечают и Stanford HAI, и International Scientific Report on the Safety of Advanced AI. Поэтому любой бенчмарк, который подают как «тест на AGI», неизбежно встраивает в себя не только инженерный протокол, но и чью-то теорию интеллекта.
У ARC эта теория прописана достаточно явно. В On the Measure of Intelligence Шолле спорит с привычной логикой «высокий skill на задаче = высокий интеллект». Его аргумент простой: skill можно «купить» большим объёмом данных, заранее внесёнными priors или гигантским опытом. Поэтому он предлагает смотреть не просто на достигнутый навык, а на то, насколько эффективно система превращает ограниченные priors и ограниченный опыт в решение новой задачи.
Именно в этом месте ARC-AGI полезно отделить от общего новостного шума 2024–2025 годов. Исторически тест — это исходный ARC из 2019 года, который позднее стали называть ARC-AGI-1. А дискуссия 2024–2025 годов важна потому, что она показала две вещи одновременно: тест действительно ловит дефицит абстракции у многих сильных моделей, но сам тоже не свободен от артефактов измерения.
Метод
Что ARC-AGI считает объектом измерения
В логике Шолле интеллект здесь — не «знает всё» и не «умеет поддержать разговор». ARC-AGI пытается измерять более узкую способность: увидеть несколько примеров новой мини-задачи, вывести правило преобразования и перенести его на новый вход. Это ближе к психометрической идее fluid intelligence, чем к проверке энциклопедических знаний или удобства продукта.
Как устроена одна задача
Задача в ARC-AGI — это набор цветных двумерных grid-пар input-output и один или несколько новых test input. В ARC Prize 2024: Technical Report сказано, что каждая задача содержит две или более демонстрационных пар, а в ARC-AGI-2 формат описан как несколько демонстраций, обычно 2–5. Решатель должен вывести скрытое правило и построить правильный output для нового входа.
Ключевой момент: задачи намеренно не должны требовать специализированных фактов о мире или языка. В отчёте ARC Prize 2024 и в работе ARC-AGI-2 это сформулировано одинаково по смыслу: предполагаются только базовые человеческие priors — объектность, счёт, симметрия, связность, простая геометрия и топология, то есть то, что авторы относят к core knowledge.
Что именно пытается контролировать дизайн
- Новизну. Каждая задача должна быть уникальной, чтобы нельзя было просто заранее выучить ответы.
- Объём опыта. Вместо длинного обучения на одном типе задач система получает лишь несколько демонстраций внутри конкретного эпизода.
- Объём priors. По замыслу тест убирает язык, доменную экспертизу и широкую world knowledge-базу.
- Контаминацию. Для этого в ARC-AGI-1 были публичные и скрытые поднаборы; позднее ARC Prize добавила semi-private набор, а затем создала ARC-AGI-2.
Если свести это к одной формуле без математики, ARC-AGI пытается спросить: может ли система быстро адаптироваться к новой абстрактной задаче, а не просто извлечь запомненный шаблон?
Результаты
Эмпирическая картина вокруг ARC-AGI важна не меньше, чем его теория. Ниже — факты, которые реально помогают понять, что именно измеряет тест и где начинаются натяжки.
| Наблюдение | Данные | Что это говорит о тесте |
|---|---|---|
| ARC-AGI-1 строился как тест новизны при минимуме внешних знаний | В официальных документах 2024–2025 годов ARC-AGI-1 описан как набор из 1 000 задач: 400 public training, 400 public evaluation, 100 semi-private evaluation и 100 private evaluation; задачи не должны требовать world knowledge или языка. | Тест в первую очередь проверяет перенос правила на новый пример, а не покрытие знаний. |
| Люди в принципе решают публичный ARC заметно лучше машин | В исследовании H-ARC средняя точность людей на public evaluation составила 64.2% после трёх попыток, а 790 из 800 публичных задач решил хотя бы один участник. Это оценка из одного исследования и она относится именно к публичным наборам ARC-AGI-1. | ARC не является набором «нечеловеческих» головоломок; он задуман как человечески доступный тест новизны. |
| Часть ARC-AGI-1 уязвима к search-стратегиям | И ARC Prize 2024 report, и ARC-AGI-2 приводят один и тот же факт: лучший одиночный submission в 2020 году имел 20% на private evaluation, но объединение задач, решённых разными командами, давало 49%. | Высокий coverage не всегда означает общий механизм абстракции; иногда это сумма эвристик и перебора. |
| Рост результатов в 2024 году связан с test-time adaptation и compute | В обоих официальных источниках зафиксированы 53.5% у лучшего open-source победителя ARC Prize 2024 и 55.5% у лучшего результата конкурса на private evaluation. Тот же отчёт отдельно подчёркивает: score теперь относится не только к методу, но и к комбинации метода с compute budget. | ARC-AGI частично измеряет адаптацию к новому правилу, но не полностью отделяет её от вычислительного ресурса. |
| ARC-AGI-2 был введён как более жёсткий сигнал | В ARC-AGI-2 и в посте Analyzing o3 and o4-mini with ARC-AGI показано, что на semi-private ARC-AGI-2 по состоянию на 14 мая 2025 года лучшие системы находились на уровне 3.0% и ниже. | Авторы сами признали: первая версия уже плохо различала фронтирные подходы и нуждалась в обновлении. |
Здесь есть важная методологическая ловушка: эти числа нельзя сравнивать «в лоб», будто это одна шкала. H-ARC измеряет людей на публичных наборах ARC-AGI-1 при конкретном интерфейсе и протоколе. Соревнования ARC Prize измеряют модели на скрытых поднаборах и при других ограничениях. А ARC-AGI-2 — это уже новый набор задач. Если этого не учитывать, легко получить красивый, но неверный headline.
Независимые работы тоже полезны для калибровки. ConceptARC прямо пишет, что исходный ARC не систематизирует проверку понимания отдельных концептов, и предлагает более контролируемый concept-based режим оценки. Работы Comparing Humans, GPT-4, and GPT-4V On Abstraction and Reasoning Tasks и LLMs and the Abstraction and Reasoning Corpus добавляют ещё одну важную деталь: успех на подобных задачах сильно зависит от того, умеет ли система выделять объекты и отношения, а не просто читать последовательность токенов.
Интерпретация
Что ARC-AGI действительно измеряет
- Few-shot перенос правила. Система видит несколько примеров и должна обобщить правило на новый вход.
- Композиционную абстракцию. Во многих задачах нужно совместить сразу несколько простых отношений: объектность, симметрию, счёт, группировку, наложение условий.
- Устойчивость к новизне. По замыслу нельзя подготовиться к конкретной задаче заранее.
- Эффективность адаптации. Особенно в интерпретации Шолле: не просто «умеет ли», а «сколько priors, данных и test-time вычислений для этого понадобилось».
Наш комментарий
На наш взгляд, ARC-AGI полезнее всего читать не как «термометр AGI вообще», а как стресс-тест на абстрактную адаптацию в маленьком искусственном мире. Это скромнее, чем звучит бренд AGI, но технически честнее. Если система стабильно сильна на ARC-AGI, это серьёзный сигнал, что она умеет нечто большее, чем retrieval и поверхностное pattern matching.
Но обратное тоже верно: даже очень высокий балл на ARC-AGI ещё не даёт основания говорить о полноте «общего интеллекта». Причина простая: сам тест намеренно исключает большие пласты когнитивных способностей — язык как открытый мир знаний, долговременную память, интерактивное исследование среды, социальное понимание, агентность и долгогоризонтное планирование. То есть ARC-AGI измеряет важный срез, но не весь объект.
Есть и ещё одна тонкость. Чем больше лучшие решения опираются на search, refinement loops и test-time adaptation, тем меньше итоговый score похож на «чистую способность модели» и тем больше он похож на оценку системы целиком: база знаний, внешний интерпретатор, бюджет семплирования, отбор гипотез, отладка программ. Для практиков это не недостаток, а факт, который надо явно проговаривать.
Ограничения и критика
- Тест теоретически нагружен. ARC не нейтрален: он встроил конкретную теорию интеллекта Шолле, где важна эффективность освоения нового навыка при фиксированных priors. Если вы не разделяете эту теорию, вы не обязаны принимать ARC как главный компас.
- Домен узкий. Цветные grids удобны тем, что убирают лишний фон, но цена — сильная абстракция от реальных сред. Умение решать такие задачи не тождественно умению действовать в открытом мире.
- ARC-AGI-1 оказался уязвим к overfitting и leakage. И ARC Prize 2024 report, и ARC-AGI-2 отдельно пишут о малом private-наборе из 100 задач и многолетней переиспользуемости скрытого теста.
- Score смешивает reasoning и compute. В официальном отчёте ARC Prize 2024 прямо сказано, что search-based подходы могут повышать балл за счёт дополнительного вычислительного бюджета, поэтому оценивать нужно не только метод, но и его стоимость.
- Сравнимость результатов ограничена. Public eval, semi-private eval, private eval и ARC-AGI-2 — это разные распределения задач и разные протоколы. Любое сравнение без указания версии и split почти наверняка вводит в заблуждение.
- Человеческие baseline тоже не идеальны. Для ARC-AGI-1 долго не было официального first-party baseline на скрытых наборах; для ARC-AGI-2 он уже есть, но это авторское внутреннее тестирование. Это лучше, чем ничего, но не то же самое, что полностью независимая внешняя репликация.
- Тест не покрывает многие аспекты AGI по конструкции. Он почти ничего не говорит о безопасности, ценностях, социальном рассуждении, работе с длинной памятью, самостоятельной постановке целей и интерактивном исследовании среды.
Вывод
Если убрать маркетинговую оболочку, ARC-AGI измеряет не «AGI целиком», а более конкретную способность: насколько эффективно система осваивает новое правило на незнакомой задаче при ограниченных priors и ограниченном опыте. Это важный и редкий тип сигнала, особенно на фоне бенчмарков, где можно выиграть за счёт памяти, данных или хорошего retrieval.
Но именно поэтому ARC-AGI надо читать буквально. Высокий результат на нём — сильный аргумент в пользу абстрактной адаптации. Низкий результат — полезный диагноз. А вот превращать любой score в окончательный вердикт об AGI пока рано и методологически неаккуратно.
Источники
- François Chollet — On the Measure of Intelligence
- ARC Prize 2024: Technical Report
- François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers, Henry Pinkard — ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems
- Solim LeGris, Wai Keen Vong, Brenden M. Lake, Todd M. Gureckis — H-ARC: A Robust Estimate of Human Performance on the Abstraction and Reasoning Corpus Benchmark
- Arseny Moskvichev, Victor Vikram Odouard, Melanie Mitchell — The ConceptARC Benchmark: Evaluating Understanding and Generalization in the ARC Domain
- Melanie Mitchell, Alessandro B. Palmarini, Arseny Moskvichev — Comparing Humans, GPT-4, and GPT-4V On Abstraction and Reasoning Tasks
- Yudong Xu, Wenhao Li, Pashootan Vaezipoor, Scott Sanner, Elias B. Khalil — LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations
- OpenAI o3 Breakthrough High Score on ARC-AGI-Pub | ARC Prize
- Analyzing o3 and o4-mini with ARC-AGI | ARC Prize
- What is AGI (Artificial General Intelligence)? | Stanford HAI
- International Scientific Report on the Safety of Advanced AI: Interim Report
FAQ
Можно ли считать ARC-AGI прямым тестом на достижение AGI?
Нет. ARC-AGI измеряет важный, но узкий срез — few-shot абстракцию и адаптацию к новизне. Само понятие AGI не имеет общепринятого точного определения, поэтому ни один отдельный benchmark пока не может быть окончательным арбитром.
Почему тогда на ARC-AGI вообще смотрят?
Потому что он пытается убрать из уравнения то, чем современные модели часто выигрывают: огромную память, world knowledge и просто большой тренировочный след. В этом смысле ARC-AGI полезен как проверка на перенос правила, а не на объём заученного.
Зачем понадобился ARC-AGI-2?
Авторы ARC Prize и ARC-AGI-2 сочли, что ARC-AGI-1 начал давать слишком шумный сигнал: скрытый набор был мал, много лет переиспользовался, а часть задач оказалась уязвима к brute-force и search-подходам. ARC-AGI-2 должен был сделать сигнал снова различимым.
