20 декабря 2024 года, в финальный день «12 Days of OpenAI», команда ARC Prize публично показала результаты unreleased-системы o3-preview на ARC-AGI-1. По опубликованному отчёту ARC Prize, эта версия набрала 75,7% на semi-private наборе в режиме с меньшим бюджетом выборок и 87,5% в режиме с примерно 172-кратным ростом test-time compute.
Из этого быстро сделали вывод «ARC пройден, значит AGI почти здесь». Но сами первоисточники говорят о более узкой и более интересной вещи: это был прорыв именно в режиме адаптации к новым задачам во время инференса, на конкретном протоколе ARC-AGI-1, для preview-версии модели, которая позже оказалась не тождественна релизному o3.
Коротко
- Событие 20 декабря 2024 года касалось не публичного релиза o3, а o3-preview, который OpenAI показывала до запуска продукта.
- Главные числа 75,7% и 87,5% относятся к ARC-AGI-1 Semi-Private Eval, опубликованы ARC Prize и завязаны на разный бюджет выборок: 6 и 1024 сэмпла.
- Это был не «чистый pass@1» и не официальный выигрыш ARC Prize: сравнение шло на ARC-AGI-Pub, где разрешены интернет и закрытые модели, а у o3-preview были переменные затраты на инференс.
- Позже ARC Prize отдельно уточнила, что релизный o3 от 16 апреля 2025 года — не тот же объект, что декабрьский preview; его результаты на ARC-AGI-1 и особенно на ARC-AGI-2 были заметно ниже.
- Технический смысл истории не в том, что «AGI достигнут», а в том, что test-time compute и поиск во время вывода стали важной осью масштабирования для reasoning-систем.
Контекст
ARC-AGI появился в работе Франсуа Шолле On the Measure of Intelligence от 5 ноября 2019 года как тест не на накопленные знания, а на способность решать новые абстрактные задачи с минимальным количеством примеров. В документах ARC Prize и в более поздней статье про ARC-AGI-2 ARC-AGI-1 описан как набор из 1000 задач: 400 public training, 400 public evaluation, 100 semi-private evaluation и 100 private evaluation; на каждый test input даётся две попытки.
Для понимания декабрьской истории важно различать два режима оценки. Официальный Kaggle-контест ARC Prize 2024 измерял private eval без интернета и с жёсткими вычислительными ограничениями. Отдельный ARC-AGI-Pub, анонсированный 27 июня 2024 года, был создан специально для проверки закрытых frontier-моделей: там разрешены интернет и большие вычисления, но вводится отдельная логика верификации и cost limit.
До o3 картина была такой. По данным ARC Prize, в июне 2024 года базовые frontier LLM почти не решали ARC-AGI-Pub: GPT-4o имел 5% на semi-private и 9% на public, Claude 3.5 Sonnet — 14% и 21%, Gemini 1.5 — 4,5% и 8%. После выхода o1-preview 13 сентября 2024 года ARC Prize опубликовала для него 18% на semi-private и 21,2% на public. К 18 декабря 2024 года лучшие открытые прикладные решения дошли до 53,6% на semi-private leaderboard ARC-AGI-Pub.
- Иными словами, до декабря 2024 года benchmark уже показывал прогресс, но не выглядел «решённым».
- Главный сдвиг состоял не просто в новой модели, а в переходе от одиночного ответа к более дорогой адаптации во время вывода.
Метод
Что именно тестировали 20 декабря 2024 года
По отчёту ARC Prize от 20 декабря 2024 года, они тестировали o3-preview на двух наборах ARC-AGI-1: Semi-Private Eval из 100 задач и Public Eval из 400 задач. По просьбе OpenAI прогоняли две конфигурации с разным числом сэмплов: 6 и 1024. В терминах поста ARC Prize режим с 6 сэмплами назван high-efficiency, а с 1024 — low-efficiency; по сути это «меньше compute» и «намного больше compute».
Что известно точно по источникам
- OpenAI уже в статье Learning to reason with LLMs от 12 сентября 2024 года прямо писала, что производительность o1 улучшается как с ростом train-time RL, так и с ростом test-time compute.
- ARC Prize для o3-preview опубликовала не только проценты точности, но и параметры прогона: число сэмплов, токены и оценку стоимости. Важно, что сама ARC Prize позже обновляла денежные оценки, потому что изначально официальной цены o3 не было.
- В том же посте ARC Prize отдельно указала: по сообщению OpenAI, тестируемый o3 был обучен на 75% public training set ARC-AGI-1, но деталей не раскрыли; влияние этого факта на итоговый результат отдельно не было изолировано.
Что остаётся гипотезой
Точного публичного описания внутреннего механизма o3-preview OpenAI не выпустила. ARC Prize и сам Шолле интерпретировали результат как признак более сильного поиска по цепочкам рассуждений во время инференса, возможно с неким внутренним оценщиком решений. Но это именно интерпретация по косвенным признакам, а не подтверждённая архитектурная спецификация.
Результаты
Ниже — сводка ключевых опубликованных чисел. Для части строк есть два независимых подтверждения внутри корпуса материалов ARC Prize; для preview-o3 точные числа 75,7% и 87,5% фактически опубликованы в одном верифицированном отчёте ARC Prize, поэтому мы явно привязываем их к этому источнику, а не выдаём за более широкий консенсус.
| Дата | Система | Набор | Результат | Что важно |
|---|---|---|---|---|
| 27 июня 2024 | GPT-4o / Claude 3.5 / Gemini 1.5 | ARC-AGI-Pub, semi-private | 5% / 14% / 4,5% | Базовые frontier LLM почти не решают ARC-AGI-1 без специального слоя адаптации. |
| 13 сентября 2024 | o1-preview | ARC-AGI-Pub, semi-private | 18% | Первый заметный сигнал от reasoning-модели OpenAI, но всё ещё далеко от лучших прикладных решений. |
| 18 декабря 2024 | Jeremy Berman | ARC-AGI-Pub, semi-private | 53,6% | Открытые системы с test-time adaptation уже показали, что дело не только в размере base model. |
| 20 декабря 2024 | o3-preview, 6 samples | ARC-AGI-1 Semi-Private Eval | 75,7% | По данным ARC Prize, результат укладывался в лимит ARC-AGI-Pub и становился новым top score этого режима. |
| 20 декабря 2024 | o3-preview, 1024 samples | ARC-AGI-1 Semi-Private Eval | 87,5% | Тот же источник сообщает, что рост compute ещё сильнее поднимал качество, но ценой резкого ухудшения эффективности. |
| 22 апреля 2025 | релизный o3, medium | ARC-AGI-1 Semi-Private Eval | 53% | ARC Prize уточнила, что публичный o3 — не тот же checkpoint, что декабрьский preview. |
| 22 апреля 2025 / 17 мая 2025 | релизный o3, medium | ARC-AGI-2 Semi-Private Eval | 2,9–3,0% | На новом benchmark-сигнале история «ARC уже побеждён» не подтверждается. |
Если смотреть не на один headline-score, а на траекторию, то происходит следующее. Сначала обычные LLM почти не двигают ARC-AGI-1. Затем открытые гибридные решения и o1 показывают, что test-time adaptation работает. Наконец, o3-preview демонстрирует, что при очень агрессивном использовании вычислений reasoning-система может резко подняться на этом benchmark. Но следующий шаг — релизный o3 и затем ARC-AGI-2 — показывает, что речь шла не о «закрытии темы AGI», а о сильном, но ограниченном режиме обобщения.
Интерпретация
Наш комментарий
На наш взгляд, в декабре 2024 года реально произошло сразу три вещи.
- ARC-AGI-1 перестал быть удобным аргументом в пользу тезиса «масштабирование не помогает вообще». Помогает — но не в форме простого роста pretraining. Прорыв пришёл вместе с большим budget на рассуждение и поиском во время вывода.
- Появилась проблема честного сравнения reasoning-систем. Когда одна система отвечает в режиме pass@1, а другая получает 6 или 1024 сэмпла и минуты внутреннего поиска на задачу, «один benchmark score» перестаёт быть самодостаточной метрикой. ARC Prize прямо подводила к этому ещё в материалах про o1 и затем зафиксировала эффективность как обязательный аспект отчётности.
- Результат оказался одновременно настоящим и легко переинтерпретируемым. Настоящим — потому что ARC Prize опубликовала верифицированный протокол и цифры. Легко переинтерпретируемым — потому что медийно он выглядел как свойство «модели o3 вообще», хотя фактически относился к preview-системе, к конкретной benchmark-семье и к конкретному вычислительному режиму.
Именно поэтому позднейший запуск ARC-AGI-2 так важен для исторической оценки. ARC Prize в мартовских и майских материалах 2025 года прямо объясняла новый benchmark как попытку вернуть измерительный сигнал после того, как ARC-AGI-1 начал приближаться к насыщению под давлением test-time adaptation. На ARC-AGI-2 релизный o3 уже не выглядел как система, «решившая ARC».
Ограничения и критика
- Preview — не релиз. 20 декабря 2024 года обсуждался o3-preview. Уже 16 апреля 2025 года OpenAI выпустила публичный o3, а 22 апреля 2025 года ARC Prize отдельно написала, что это не та же система.
- Есть фактор обучающего контакта с benchmark. По сообщению ARC Prize, тестируемый preview был обучен на 75% public training set ARC-AGI-1. Это не эквивалент «натренирован на ответы eval», но и не нулевая связь с benchmark-доменом.
- Сравнение не симметрично по бюджету вычислений. Более ранние baseline-числа часто подавались как pass@1 или близкий к нему режим, тогда как у o3-preview ключевой рост был связан с множественными сэмплами и длинным временем инференса.
- Стоимость в декабрьском посте не стоит читать как стабильный продуктовый прайс. ARC Prize сама несколько раз обновляла денежные оценки по мере появления новых ориентиров по pricing.
- ARC-AGI-1 не равен AGI. Сам Шолле в декабрьском посте отдельно писал, что прохождение ARC-AGI не является «кислотным тестом AGI», а o3 всё ещё проваливал некоторые лёгкие для человека задачи.
- Позднейший ARC-AGI-2 меняет историческую рамку. Если брать не один декабрьский headline, а серию источников до мая 2025 года, история читается как «мощный скачок на ARC-AGI-1 за счёт reasoning+search», а не как «общий интеллект уже достигнут».
Заключение
Если читать только заголовки, то декабрь 2024 года выглядел как момент, когда o3 «взял ARC и почти доказал AGI». Если читать первоисточники, картина точнее: ARC Prize показала сильный результат o3-preview на ARC-AGI-1 в режиме дорогого test-time reasoning, а последующие публикации уточнили, что релизный o3 отличается от preview и что ARC-AGI-2 остаётся для таких систем очень трудной задачей.
Главный урок для практиков простой: в эпоху reasoning-моделей нужно спрашивать не только «какой score?», но и «какой протокол, какой compute, какой checkpoint и какой benchmark-version?». Без этих четырёх уточнений разговор о прогрессе быстро превращается в шум.
Источники
- François Chollet — On the Measure of Intelligence
- Mike Knoop — Introducing the ARC-AGI Public Leaderboard
- Mike Knoop — OpenAI o1 Results on ARC-AGI-Pub
- François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers — ARC Prize 2024: Technical Report
- Greg Kamradt — 2024 Progress on ARC-AGI-Pub
- François Chollet — OpenAI o3 Breakthrough High Score on ARC-AGI-Pub
- OpenAI — 12 Days of OpenAI: Day 12
- OpenAI — Learning to reason with LLMs
- OpenAI — Introducing OpenAI o3 and o4-mini
- Greg Kamradt — Analyzing o3 and o4-mini with ARC-AGI
- François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers, Henry Pinkard — ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems
FAQ
o3 действительно «победил ARC-AGI»?
Не в строгом соревновательном смысле ARC Prize. Декабрьский результат относился к ARC-AGI-Pub и к preview-системе; это не был официальный open-source выигрыш private leaderboard с соблюдением правил Kaggle-контеста.
Можно ли считать декабрьский score доказательством AGI?
Нет. И ARC Prize, и сам Шолле отдельно оговаривали, что ARC-AGI — полезный исследовательский инструмент, но не исчерпывающий тест AGI. Позднейшие результаты на ARC-AGI-2 это только усилили.
Почему нельзя напрямую сравнить o3-preview и релизный o3?
Потому что ARC Prize после релиза прямо написала, что публичный o3 отличается от декабрьского preview. Плюс изменились продуктовые ограничения, мультимодальность и доступный budget на рассуждение.
Какой главный технический вывод для разработчиков?
Benchmark-результат reasoning-модели нужно читать как свойство системы с конкретным compute budget. Для практики важны не только проценты точности, но и число попыток, время на задачу, токены, стоимость и версия benchmark.
