Запись архива

o3 и штурм ARC-AGI: что реально произошло

Разбираем по первоисточникам, что именно OpenAI и ARC Prize показали 20 декабря 2024 года: какой o3 тестировали, на каком протоколе, почему 75,7% и 87,5% не означали «AGI достигнут», и что изменилось после релиза o3 и запуска ARC-AGI-2.

Хронология результатов ARC-AGI: базовые LLM, o1-preview, o3-preview и релизный o3 на фоне запуска ARC-AGI-2

20 декабря 2024 года, в финальный день «12 Days of OpenAI», команда ARC Prize публично показала результаты unreleased-системы o3-preview на ARC-AGI-1. По опубликованному отчёту ARC Prize, эта версия набрала 75,7% на semi-private наборе в режиме с меньшим бюджетом выборок и 87,5% в режиме с примерно 172-кратным ростом test-time compute.

Из этого быстро сделали вывод «ARC пройден, значит AGI почти здесь». Но сами первоисточники говорят о более узкой и более интересной вещи: это был прорыв именно в режиме адаптации к новым задачам во время инференса, на конкретном протоколе ARC-AGI-1, для preview-версии модели, которая позже оказалась не тождественна релизному o3.

Коротко

  • Событие 20 декабря 2024 года касалось не публичного релиза o3, а o3-preview, который OpenAI показывала до запуска продукта.
  • Главные числа 75,7% и 87,5% относятся к ARC-AGI-1 Semi-Private Eval, опубликованы ARC Prize и завязаны на разный бюджет выборок: 6 и 1024 сэмпла.
  • Это был не «чистый pass@1» и не официальный выигрыш ARC Prize: сравнение шло на ARC-AGI-Pub, где разрешены интернет и закрытые модели, а у o3-preview были переменные затраты на инференс.
  • Позже ARC Prize отдельно уточнила, что релизный o3 от 16 апреля 2025 года — не тот же объект, что декабрьский preview; его результаты на ARC-AGI-1 и особенно на ARC-AGI-2 были заметно ниже.
  • Технический смысл истории не в том, что «AGI достигнут», а в том, что test-time compute и поиск во время вывода стали важной осью масштабирования для reasoning-систем.

Контекст

ARC-AGI появился в работе Франсуа Шолле On the Measure of Intelligence от 5 ноября 2019 года как тест не на накопленные знания, а на способность решать новые абстрактные задачи с минимальным количеством примеров. В документах ARC Prize и в более поздней статье про ARC-AGI-2 ARC-AGI-1 описан как набор из 1000 задач: 400 public training, 400 public evaluation, 100 semi-private evaluation и 100 private evaluation; на каждый test input даётся две попытки.

Для понимания декабрьской истории важно различать два режима оценки. Официальный Kaggle-контест ARC Prize 2024 измерял private eval без интернета и с жёсткими вычислительными ограничениями. Отдельный ARC-AGI-Pub, анонсированный 27 июня 2024 года, был создан специально для проверки закрытых frontier-моделей: там разрешены интернет и большие вычисления, но вводится отдельная логика верификации и cost limit.

До o3 картина была такой. По данным ARC Prize, в июне 2024 года базовые frontier LLM почти не решали ARC-AGI-Pub: GPT-4o имел 5% на semi-private и 9% на public, Claude 3.5 Sonnet — 14% и 21%, Gemini 1.5 — 4,5% и 8%. После выхода o1-preview 13 сентября 2024 года ARC Prize опубликовала для него 18% на semi-private и 21,2% на public. К 18 декабря 2024 года лучшие открытые прикладные решения дошли до 53,6% на semi-private leaderboard ARC-AGI-Pub.

  • Иными словами, до декабря 2024 года benchmark уже показывал прогресс, но не выглядел «решённым».
  • Главный сдвиг состоял не просто в новой модели, а в переходе от одиночного ответа к более дорогой адаптации во время вывода.

Метод

Что именно тестировали 20 декабря 2024 года

По отчёту ARC Prize от 20 декабря 2024 года, они тестировали o3-preview на двух наборах ARC-AGI-1: Semi-Private Eval из 100 задач и Public Eval из 400 задач. По просьбе OpenAI прогоняли две конфигурации с разным числом сэмплов: 6 и 1024. В терминах поста ARC Prize режим с 6 сэмплами назван high-efficiency, а с 1024 — low-efficiency; по сути это «меньше compute» и «намного больше compute».

Что известно точно по источникам

  • OpenAI уже в статье Learning to reason with LLMs от 12 сентября 2024 года прямо писала, что производительность o1 улучшается как с ростом train-time RL, так и с ростом test-time compute.
  • ARC Prize для o3-preview опубликовала не только проценты точности, но и параметры прогона: число сэмплов, токены и оценку стоимости. Важно, что сама ARC Prize позже обновляла денежные оценки, потому что изначально официальной цены o3 не было.
  • В том же посте ARC Prize отдельно указала: по сообщению OpenAI, тестируемый o3 был обучен на 75% public training set ARC-AGI-1, но деталей не раскрыли; влияние этого факта на итоговый результат отдельно не было изолировано.

Что остаётся гипотезой

Точного публичного описания внутреннего механизма o3-preview OpenAI не выпустила. ARC Prize и сам Шолле интерпретировали результат как признак более сильного поиска по цепочкам рассуждений во время инференса, возможно с неким внутренним оценщиком решений. Но это именно интерпретация по косвенным признакам, а не подтверждённая архитектурная спецификация.

Результаты

Ниже — сводка ключевых опубликованных чисел. Для части строк есть два независимых подтверждения внутри корпуса материалов ARC Prize; для preview-o3 точные числа 75,7% и 87,5% фактически опубликованы в одном верифицированном отчёте ARC Prize, поэтому мы явно привязываем их к этому источнику, а не выдаём за более широкий консенсус.

Дата Система Набор Результат Что важно
27 июня 2024 GPT-4o / Claude 3.5 / Gemini 1.5 ARC-AGI-Pub, semi-private 5% / 14% / 4,5% Базовые frontier LLM почти не решают ARC-AGI-1 без специального слоя адаптации.
13 сентября 2024 o1-preview ARC-AGI-Pub, semi-private 18% Первый заметный сигнал от reasoning-модели OpenAI, но всё ещё далеко от лучших прикладных решений.
18 декабря 2024 Jeremy Berman ARC-AGI-Pub, semi-private 53,6% Открытые системы с test-time adaptation уже показали, что дело не только в размере base model.
20 декабря 2024 o3-preview, 6 samples ARC-AGI-1 Semi-Private Eval 75,7% По данным ARC Prize, результат укладывался в лимит ARC-AGI-Pub и становился новым top score этого режима.
20 декабря 2024 o3-preview, 1024 samples ARC-AGI-1 Semi-Private Eval 87,5% Тот же источник сообщает, что рост compute ещё сильнее поднимал качество, но ценой резкого ухудшения эффективности.
22 апреля 2025 релизный o3, medium ARC-AGI-1 Semi-Private Eval 53% ARC Prize уточнила, что публичный o3 — не тот же checkpoint, что декабрьский preview.
22 апреля 2025 / 17 мая 2025 релизный o3, medium ARC-AGI-2 Semi-Private Eval 2,9–3,0% На новом benchmark-сигнале история «ARC уже побеждён» не подтверждается.

Если смотреть не на один headline-score, а на траекторию, то происходит следующее. Сначала обычные LLM почти не двигают ARC-AGI-1. Затем открытые гибридные решения и o1 показывают, что test-time adaptation работает. Наконец, o3-preview демонстрирует, что при очень агрессивном использовании вычислений reasoning-система может резко подняться на этом benchmark. Но следующий шаг — релизный o3 и затем ARC-AGI-2 — показывает, что речь шла не о «закрытии темы AGI», а о сильном, но ограниченном режиме обобщения.

Интерпретация

Наш комментарий

На наш взгляд, в декабре 2024 года реально произошло сразу три вещи.

  1. ARC-AGI-1 перестал быть удобным аргументом в пользу тезиса «масштабирование не помогает вообще». Помогает — но не в форме простого роста pretraining. Прорыв пришёл вместе с большим budget на рассуждение и поиском во время вывода.
  2. Появилась проблема честного сравнения reasoning-систем. Когда одна система отвечает в режиме pass@1, а другая получает 6 или 1024 сэмпла и минуты внутреннего поиска на задачу, «один benchmark score» перестаёт быть самодостаточной метрикой. ARC Prize прямо подводила к этому ещё в материалах про o1 и затем зафиксировала эффективность как обязательный аспект отчётности.
  3. Результат оказался одновременно настоящим и легко переинтерпретируемым. Настоящим — потому что ARC Prize опубликовала верифицированный протокол и цифры. Легко переинтерпретируемым — потому что медийно он выглядел как свойство «модели o3 вообще», хотя фактически относился к preview-системе, к конкретной benchmark-семье и к конкретному вычислительному режиму.

Именно поэтому позднейший запуск ARC-AGI-2 так важен для исторической оценки. ARC Prize в мартовских и майских материалах 2025 года прямо объясняла новый benchmark как попытку вернуть измерительный сигнал после того, как ARC-AGI-1 начал приближаться к насыщению под давлением test-time adaptation. На ARC-AGI-2 релизный o3 уже не выглядел как система, «решившая ARC».

Ограничения и критика

  1. Preview — не релиз. 20 декабря 2024 года обсуждался o3-preview. Уже 16 апреля 2025 года OpenAI выпустила публичный o3, а 22 апреля 2025 года ARC Prize отдельно написала, что это не та же система.
  2. Есть фактор обучающего контакта с benchmark. По сообщению ARC Prize, тестируемый preview был обучен на 75% public training set ARC-AGI-1. Это не эквивалент «натренирован на ответы eval», но и не нулевая связь с benchmark-доменом.
  3. Сравнение не симметрично по бюджету вычислений. Более ранние baseline-числа часто подавались как pass@1 или близкий к нему режим, тогда как у o3-preview ключевой рост был связан с множественными сэмплами и длинным временем инференса.
  4. Стоимость в декабрьском посте не стоит читать как стабильный продуктовый прайс. ARC Prize сама несколько раз обновляла денежные оценки по мере появления новых ориентиров по pricing.
  5. ARC-AGI-1 не равен AGI. Сам Шолле в декабрьском посте отдельно писал, что прохождение ARC-AGI не является «кислотным тестом AGI», а o3 всё ещё проваливал некоторые лёгкие для человека задачи.
  6. Позднейший ARC-AGI-2 меняет историческую рамку. Если брать не один декабрьский headline, а серию источников до мая 2025 года, история читается как «мощный скачок на ARC-AGI-1 за счёт reasoning+search», а не как «общий интеллект уже достигнут».

Заключение

Если читать только заголовки, то декабрь 2024 года выглядел как момент, когда o3 «взял ARC и почти доказал AGI». Если читать первоисточники, картина точнее: ARC Prize показала сильный результат o3-preview на ARC-AGI-1 в режиме дорогого test-time reasoning, а последующие публикации уточнили, что релизный o3 отличается от preview и что ARC-AGI-2 остаётся для таких систем очень трудной задачей.

Главный урок для практиков простой: в эпоху reasoning-моделей нужно спрашивать не только «какой score?», но и «какой протокол, какой compute, какой checkpoint и какой benchmark-version?». Без этих четырёх уточнений разговор о прогрессе быстро превращается в шум.

Источники

FAQ

o3 действительно «победил ARC-AGI»?

Не в строгом соревновательном смысле ARC Prize. Декабрьский результат относился к ARC-AGI-Pub и к preview-системе; это не был официальный open-source выигрыш private leaderboard с соблюдением правил Kaggle-контеста.

Можно ли считать декабрьский score доказательством AGI?

Нет. И ARC Prize, и сам Шолле отдельно оговаривали, что ARC-AGI — полезный исследовательский инструмент, но не исчерпывающий тест AGI. Позднейшие результаты на ARC-AGI-2 это только усилили.

Почему нельзя напрямую сравнить o3-preview и релизный o3?

Потому что ARC Prize после релиза прямо написала, что публичный o3 отличается от декабрьского preview. Плюс изменились продуктовые ограничения, мультимодальность и доступный budget на рассуждение.

Какой главный технический вывод для разработчиков?

Benchmark-результат reasoning-модели нужно читать как свойство системы с конкретным compute budget. Для практики важны не только проценты точности, но и число попыток, время на задачу, токены, стоимость и версия benchmark.

Читайте также