Запись архива

NVIDIA AVO и ARC-AGI-3: почему модель ещё не агент

NVIDIA заявила о 100% на публичной части ARC-AGI-3 с Claude Opus 5. Разбираем, какую роль сыграли память, supervisor, инструменты и recovery — и почему этот результат нельзя напрямую сравнивать с модельными 30% или считать доказательством AGI.

Схема AVO с Claude Opus 5, памятью, supervisor, feedback и recovery для ARC-AGI-3

Результат NVIDIA на ARC-AGI-3 выглядит как простой заголовок: Claude Opus 5 в системе AVO достиг 100.00 RHAE на всех 25 публичных окружениях, пройдя 183 уровня и выполнив 6 624 действия среды. Но такая формулировка скрывает главный технический сюжет. Измерялась не только способность базовой модели рассуждать. В эксперименте участвовала полная агентная система: с persistent memory, supervisor, инструментами, обратной связью от среды и механизмами восстановления.

Это принципиально меняет вопрос. Нужно спрашивать не только, насколько хорошо отвечает модель, но и как система организует длинную последовательность действий: что она сохраняет, когда пересматривает план, как видит наблюдение, как исправляет ошибку и сколько действий тратит на получение результата.

Ниже мы отделяем заявленный NVIDIA факт от его интерпретации, сравниваем system-level и model-level оценки, разбираем ограничения public set и предлагаем практический протокол проверки агентных рекордов. Фактологический срез материала — 27 августа 2026 года.

Коротко

  • Факт: NVIDIA сообщила о 100.00 RHAE на всех 25 публичных окружениях ARC-AGI-3, 183 пройденных уровнях и 6 624 действиях среды с Claude Opus 5 в AVO.
  • Что именно оценивалось: не изолированная модель, а полный agent system с persistent memory, supervisor, execution feedback и recovery.
  • Представление наблюдений: для ARC NVIDIA использовала текстовую сетку 64×64 без image tokens. Это важная часть конфигурации, а не нейтральная деталь интерфейса.
  • Сравнение с 30%: NVIDIA сопоставляет свой результат примерно с 30% для опубликованной ARC Prize model-level configuration. Это не чистая controlled ablation: меняется не одна настройка, а сам уровень системы.
  • Статус проверки: речь идёт о public set. Community leaderboard указывает, что такие результаты обычно являются self-reported; private и semi-private competition sets этим заявлением не закрыты.
  • Главный вывод: 100% public-set score показывает силу конкретной связки model plus harness на публичной оценке. Он не доказывает универсальный интеллект, независимую воспроизводимость или победу в private competition.

Редакционная рекомендация: читать этот кейс как исследование интерфейса между моделью и средой. Самая важная новость здесь не магическое превращение модели в агента, а демонстрация того, что архитектура управления контекстом, памятью и ошибками может радикально изменить наблюдаемую производительность.

Что на самом деле показала NVIDIA

В статье NVIDIA заявляет, что AVO с Claude Opus 5 получила 100.00 RHAE на всех 25 публичных окружениях ARC-AGI-3. В заявленном прогоне система прошла 183 уровня и использовала 6 624 действия среды. Это конкретный результат на конкретном наборе, в конкретной конфигурации.

Здесь важно не терять единицы измерения. 100.00 RHAE — это итоговая оценка по правилам ARC-AGI-3, а не вероятность правильного ответа на отдельный запрос и не доля успешных токенов. 25 окружений и 183 уровня описывают объём публичной проверки, а 6 624 действия — операционную стоимость прохождения в данной конфигурации.

Факт. В публикации NVIDIA результат относится к public set. Он не равен результату на semi-private или fully private competition sets.

Интерпретация. Достижение 100% говорит, что предъявленная система справилась со всеми публичными окружениями и уровнями, которые вошли в этот прогон по указанной методике. Оно не говорит, что та же система одинаково хорошо обобщается на скрытые задания.

Ограничение. Читатель не должен складывать в одну шкалу 30% model-level configuration и 100% полного агента без поправки на состав эксперимента. В первом случае объект сравнения — конфигурация модели; во втором — система, включающая модель и внешний контур управления.

Что заявлено Что это означает Чего из этого нельзя заключать
100.00 RHAE Итоговый score по методике ARC-AGI-3 для данного прогона Что модель обладает общей интеллектуальной универсальностью
25 публичных окружений Проверен public set, указанный в заявлении Что пройдены private или semi-private competition sets
183 пройденных уровня Система завершила указанное число уровней в публичной оценке Что все уровни решались одним и тем же коротким рассуждением
6 624 действия среды Зафиксирована операционная цена заявленного прогона Что это оптимальное или минимально возможное число действий
Claude Opus 5 в AVO Оценена связка модели с агентной архитектурой Что это результат Claude Opus 5 без memory, supervisor и recovery

Как устроен ARC-AGI-3

В рамках данного кейса ARC-AGI-3 нужно рассматривать как интерактивную оценку, где системе приходится не просто выдать текстовый ответ, а действовать в окружении и получать от него обратную связь. Именно поэтому количество действий становится содержательной метрикой: агенту нужно выбрать ход, увидеть последствие и продолжить цикл.

Источник с техническим отчётом ARC-AGI-3 описывает наборы данных и методику RHAE, а документация ARC Prize фиксирует правила scoring. Для текущего разбора важны три уровня структуры: окружение, уровни внутри проверки и разделение наборов на public, semi-private и fully private competition sets.

Факт. В сообщении NVIDIA фигурируют 25 публичных окружений и 183 пройденных уровня. Это не описание одного большого вопроса, а агрегированный результат на интерактивной проверке.

Как это работает в практическом смысле. Агент получает наблюдение, выбирает действие, отправляет его в среду, получает execution feedback и либо продолжает план, либо меняет его. Если архитектура умеет сохранять состояние и возвращаться после неудачи, она может использовать не только текущий фрагмент контекста, но и историю взаимодействия.

Это отличает ARC-подобную задачу от статического теста. В статическом тесте полезный вопрос часто звучит так: какой ответ модель сгенерировала с первого раза? В интерактивном окружении добавляются вопросы: сколько попыток потребовалось, как система интерпретировала обратную связь, заметила ли собственную ошибку, не потеряла ли важное наблюдение и сумела ли завершить длинную последовательность.

Публичная часть также меняет смысл рекорда. Она нужна для открытого сравнения, но уже опубликованная среда не создаёт тот же уровень неопределённости, что скрытая конкурсная оценка. Поэтому public score полезен как демонстрация работы на доступной проверке, но слабее отвечает на вопрос о переносе стратегии на новые задания.

Что измеряет RHAE

RHAE в этом материале — метрика ARC-AGI-3, применяемая для агрегирования результатов по интерактивным окружениям и уровням. Точная формула и правила scoring вынесены в методологию ARC Prize; их следует использовать как нормативный источник, а не восстанавливать по одному пресс-релизному числу.

Для понимания кейса достаточно разделить четыре сущности:

  • RHAE: итоговая оценка по правилам бенчмарка;
  • окружения: 25 публичных сред, названных в заявлении NVIDIA;
  • уровни: 183 завершённых уровня в указанном прогоне;
  • действия: 6 624 операции взаимодействия со средой.

Эти числа отвечают на разные вопросы. RHAE отвечает на вопрос о качестве результата по scoring methodology. Число уровней показывает объём выполненной проверки. Число действий приближает нас к эффективности поведения, но само по себе не раскрывает, насколько действия были необходимы, какие из них были восстановительными, а какие — исследовательскими.

Интерпретация. Нельзя автоматически считать меньшее количество действий доказательством более сильного рассуждения. Агент может экономить действия за счёт более точного плана, а может пропускать исследование и чаще ошибаться. Поэтому action count нужно читать вместе с успешностью, правилами остановки, бюджетом и одинаковостью backend.

Ограничение. В переданном пакете нет полной числовой раскладки RHAE по каждому окружению и уровню. Значит, редакционно корректно говорить о заявленном агрегированном score, а не строить дополнительные выводы о том, какие конкретные типы задач были лёгкими или сложными.

Из чего состоит AVO

AVO — Agentic Variation Operators for Autonomous Evolutionary Search; техническое описание вынесено в отдельную исследовательскую работу. В ARC-кейсе NVIDIA описывает AVO как general-purpose architecture for long-horizon autonomous agents. Важное слово здесь — architecture: система задаёт не только модель, но и порядок работы вокруг неё.

В заявленной конфигурации AVO использует persistent memory, supervisor, execution feedback и recovery. Для ARC дополнительно указано представление наблюдения в виде текстовой сетки 64×64 без image tokens. Эти компоненты образуют harness — контур, который соединяет языковую модель с интерактивной средой.

Компонент Функциональная роль Почему он может влиять на score
Persistent memory Сохраняет состояние и полезные сведения между шагами Снижает риск потерять закономерность или прошлую ошибку в длинном эпизоде
Supervisor Координирует работу исполнительного цикла и смену режима Разделяет планирование, исполнение, контроль и пересмотр
Execution feedback Возвращает системе последствия действия Позволяет проверять гипотезу по результату, а не только по внутреннему рассуждению
Recovery Даёт возможность продолжить после неудачного шага Снижает стоимость единичной ошибки в длинной последовательности
Text grid 64×64 Представляет наблюдение в текстовой форме Определяет, какие структуры доступны модели и как расходуется контекст

Это не пять независимых переключателей. Память без контроля может накапливать шум. Supervisor без качественной обратной связи будет принимать решения на неполной картине. Recovery без понятной диагностики может повторять неудачную стратегию. А представление наблюдения определяет, что именно система вообще может заметить.

Редакционная рекомендация: при сравнении агентов описывайте harness как часть экспериментального объекта. Формула «модель X набрала Y» недостаточна, если Y получено в системе с отдельной памятью, маршрутизацией, инструментами и механизмом восстановления.

Память и supervisor

Persistent memory и supervisor решают разные, хотя и связанные задачи. Память отвечает за сохранение информации во времени. Supervisor отвечает за организацию процесса, в котором эта информация используется. В коротком запросе их вклад может быть незаметен; в long-horizon сценарии именно эти слои определяют, превращается ли последовательность локальных ответов в управляемое поведение.

Память как защита от потери состояния

В интерактивной задаче наблюдения и действия распределены по шагам. Если каждый новый шаг рассматривается без аккуратного доступа к прошлому, система рискует повторить уже проверенную гипотезу, забыть отрицательный результат или потерять связь между условием и последствием. Persistent memory в такой архитектуре выполняет роль долговременного слоя состояния.

Но само наличие памяти не гарантирует улучшения. Важны политика записи, извлечения и обновления — а конкретные внутренние детали этой политики нельзя додумывать по краткому публичному описанию. Поэтому корректная проверка должна фиксировать, какая память использовалась, сохранялась ли она между уровнями и могла ли она содержать сведения из предыдущих запусков.

Supervisor как контур управления

Supervisor полезно понимать не как ещё одну модель, а как управляющий слой, который помогает распределить работу между режимами. Он может быть связан с планированием, выполнением, проверкой результата и восстановлением, но конкретную реализацию нельзя подменять общей схемой. В редакционном смысле важен сам принцип: система получает возможность не отвечать одним непрерывным потоком, а циклически пересматривать состояние задачи.

Интерпретация. Если базовая модель в model-level configuration должна самостоятельно удерживать весь цикл в одном контексте, то agent system может вынести часть этой работы в отдельные управляющие механизмы. Это и есть одна из причин, по которой system-level score способен заметно отличаться от model-level score.

Ограничение. Из факта наличия supervisor нельзя заключать, что он всегда принимает правильные решения или полностью устраняет ошибки планирования. Его вклад должен проверяться абляциями: память без supervisor, supervisor без памяти, разные правила восстановления и одинаковые бюджеты действий.

Почему harness меняет score

Harness меняет score потому, что он меняет не только удобство использования модели, но и саму задачу управления информацией. Одна и та же модель может получать наблюдение в разных форматах, видеть разный контекст, иметь или не иметь возможность проверить действие и по-разному переживать ошибку.

В ARC-кейсе это особенно заметно по четырём каналам.

  1. Наблюдение. 64×64 text grid без image tokens — это конкретный способ кодирования среды. Модель работает не с необработанными image tokens, а с текстовой структурой.
  2. Контекст. Память и context management определяют, какие прошлые события остаются доступными, а какие отбрасываются или сжимаются.
  3. Действие. Инструментальный слой превращает текстовое решение в операцию среды и возвращает последствие.
  4. Ошибка. Recovery определяет, заканчивается ли неудача эпизода или становится сигналом для новой попытки.

Такая архитектура может дать прирост даже без изменения базовых весов. Это не означает, что harness «рисует» результат или что модель не играет роли. Это означает, что измеряется совместная способность модели и управляющего контура решать задачу.

Независимый пример из пакета — материал OpenAI о том, как две настройки утроили ARC-AGI-3 scores. Он важен не как подтверждение именно результата NVIDIA, а как отдельная иллюстрация того, что параметры запуска и управление контекстом способны существенно менять наблюдаемую оценку. Это усиливает методологический вывод: benchmark score принадлежит конфигурации, а не абстрактной сущности «модель вообще».

Есть и сравнение с VISTA: заявлено, что AVO использовала на 12% меньше действий. Но это не controlled ablation. Между системами различаются backend, representation, memory и context management. При таком наборе различий нельзя приписать разницу только одному компоненту.

Разбор числа 30%

Число примерно 30% появляется как сопоставление с model-level configuration, опубликованной ARC Prize. NVIDIA подчёркивает, что различаются reasoning setting и полный agent system. Это важная оговорка, которую нельзя превращать в мелкий шрифт.

Если обозначить два эксперимента условно как M и A, то M — модельная конфигурация, а A — модель плюс harness. Сравнение M ≈ 30% и A = 100% показывает разницу между двумя системными режимами, но не измеряет чистый эффект одного переключателя. Между ними могут одновременно отличаться память, supervisor, формат наблюдения, инструменты, recovery, context management и правила исполнения.

Что можно сказать уверенно: system-level configuration из заявления NVIDIA показала существенно более высокий public-set score, чем приведённая для контекста model-level configuration.

Чего сказать нельзя: что именно harness в одиночку добавил 70 процентных пунктов; что Claude Opus 5 без оболочки обязательно ограничен 30%; что все 70 пунктов получены только за счёт памяти; что сравнение является независимым head-to-head экспериментом.

Параметр сравнения Model-level configuration AVO agent system
Объект оценки Конфигурация модели Модель вместе с полной агентной архитектурой
Заявленный ориентир Около 30%, опубликовано ARC Prize 100.00 RHAE, заявлено NVIDIA
Память и supervisor Не следует автоматически считать их частью baseline В заявленном описании присутствуют persistent memory и supervisor
Интерактивный цикл Нужно сверять конкретный reasoning setting Есть execution feedback и recovery
Сопоставимость Неполная без полного протокола и controlled ablation

Редакционная рекомендация: заголовок «с 30% до 100%» допустим только как описание перехода между двумя конфигурациями, а не как утверждение о чистом приросте одной модели. В тексте рядом с таким сравнением обязательно должны стоять слова «model-level», «agent system» и оговорка о неполной сопоставимости.

Public set против private set

Публичный результат и конкурсная private evaluation отвечают на разные вопросы. Public set даёт возможность сообществу увидеть конфигурацию и заявленный score. Semi-private и fully private sets должны снижать риск того, что система оптимизировалась под уже известные примеры. Само наличие нескольких режимов оценки делает разграничение принципиальным.

Конкурсная страница ARC Prize описывает private evaluation и требования соревнования. В сообщении NVIDIA нет утверждения о прохождении private competition sets, поэтому переносить 100.00 RHAE с public set на конкурсную скрытую часть нельзя.

Community leaderboard дополнительно сообщает, что public-set results обычно self-reported. Это не обвинение и не доказательство ошибки. Это статус доказательства: результат заявлен участником и нуждается в проверяемом протоколе, логах, конфигурации и, для конкурсного вывода, в соответствующей независимой оценке.

Практическая разница состоит в возможности адаптации. Если набор доступен, исследователь может менять prompt, representation, memory policy или recovery и сразу смотреть на известные задачи. Даже без намеренной утечки это создаёт другой режим разработки, чем оценка на скрытых средах. Поэтому public score особенно полезен для обсуждения архитектуры и воспроизводимости, а private score — для проверки обобщения и конкурсной устойчивости.

Факт: результат AVO в пакете относится к public set.

Ограничение: пакет не содержит independent audit или private-set score для этого заявления.

Редакционная рекомендация: в карточках результатов всегда выводить отдельные поля Public, Semi-private, Private, Self-reported и Independently verified. Пустое поле — это не ноль, а отсутствие опубликованного подтверждения.

Почему 100% не означает AGI

AGI — более широкая претензия, чем идеальный результат на одной публичной проверке. Даже если score корректен, он показывает работу системы в рамках заданного benchmark, его интерфейса, набора окружений, методики и бюджета действий. Он не измеряет автоматически все формы переноса, самостоятельной постановки целей, устойчивости к изменению интерфейса или способности работать в неописанных условиях.

Есть как минимум пять причин не делать скачок от 100% к AGI:

  1. Ограниченность покрытия. 25 public environments и 183 уровня — значимый, но всё же конкретный набор проверки.
  2. Зависимость от интерфейса. Результат получен при представлении ARC-наблюдения как 64×64 text grid без image tokens.
  3. Зависимость от harness. Память, supervisor, инструменты, обратная связь и recovery входят в объект измерения.
  4. Публичность данных. Public set не является тем же самым, что hidden competition evaluation.
  5. Отсутствие независимой проверки в пакете. Community leaderboard характеризует публичные результаты как обычно self-reported.

Это не обесценивает достижение. Напротив, оно делает его точнее: AVO показала, что правильно организованный agent system способен полностью закрыть заявленный public set в выбранной конфигурации. Такой результат важен для инженерии агентов, но его область действия должна оставаться видимой.

Интерпретация. В данном кейсе «модель ещё не агент» означает не то, что модель бесполезна без оболочки, а то, что агентность — свойство связки. Планирование, память, действие, наблюдение и восстановление должны быть соединены в рабочий цикл. При этом наличие цикла также не превращает систему автоматически в общий интеллект.

Как проверять агентные рекорды

Проверка агентного рекорда сложнее проверки ответа модели, потому что объект эксперимента распределён по нескольким слоям. Нужно установить не только название модели, но и всё, что происходило между наблюдением и действием.

Минимальный набор вопросов

  • Какой именно set использован: public, semi-private или fully private?
  • Кто сообщил результат и был ли он независимо проверен?
  • Что является score unit: итоговый RHAE, уровень, окружение или иная агрегированная величина?
  • Какие модель и reasoning setting использованы?
  • Были ли persistent memory и supervisor?
  • Как кодировалось наблюдение: текст, изображение или другой формат?
  • Какие инструменты и execution feedback были доступны?
  • Разрешались ли recovery, retries и повторные попытки?
  • Как считались действия и какие операции входили в action budget?
  • Могла ли память переноситься между уровнями или запусками?
  • Был ли проведён controlled ablation каждого слоя?
  • Опубликованы ли логи, версии конфигурации и правила остановки?

Практический чек-лист публикации

  1. Назвать набор. Явно указать public, semi-private или fully private evaluation.
  2. Отделить заявление от проверки. Пометить self-reported результат и не называть его независимым аудитом.
  3. Зафиксировать модель. Указать точное имя модели и reasoning setting, если он входит в описание эксперимента.
  4. Описать harness. Перечислить memory, supervisor, инструменты, feedback и recovery.
  5. Описать наблюдение. Указать формат, размерность и наличие или отсутствие image tokens.
  6. Опубликовать action budget. Показать общее число действий и правила, по которым они считались.
  7. Разделить score и стоимость. Не выдавать меньшее число действий за качество без сопоставимой успешности.
  8. Провести абляции. По возможности менять один компонент за раз, а не сравнивать две полностью разные системы.
  9. Проверить перенос памяти. Зафиксировать, что сохраняется между уровнями и запусками.
  10. Показать recovery policy. Указать, какие ошибки дают право на повтор и как это влияет на бюджет.
  11. Сверить backend. Не сравнивать action count напрямую, если отличаются backend и правила исполнения.
  12. Добавить скрытую проверку. Для сильных заявлений нужен evaluation на данных, которые не использовались при настройке.

Этот список не требует раскрывать опасные детали реализации или внутренние секреты. Его задача — сделать экспериментальную единицу видимой. Без такой прозрачности рекорд может быть технически настоящим, но методологически переинтерпретированным.

Что меняет сравнение с VISTA

VISTA — сравниваемый harness, представленный как visual harness for reasoning in an interactive world. В пакете указано сравнение, в котором AVO использовала на 12% меньше действий. Это полезная цифра для обсуждения эффективности, но она не превращает сравнение в строгую абляцию.

Причина в том, что между AVO и VISTA различаются сразу несколько переменных: backend, representation, memory и context management. Если итоговый action count изменился, по имеющимся данным нельзя определить, какая именно переменная дала вклад и был ли выигрыш одинаковым на всех уровнях.

Факт: заявлена разница в 12% по числу действий относительно VISTA.

Ограничение: это не controlled ablation с одинаковым backend, одинаковым представлением, одинаковой памятью и одинаковым управлением контекстом.

Как проверять: для честного эксперимента нужно зафиксировать общую модель, один набор, одинаковый action budget, правила остановки и формат наблюдения, а затем менять только исследуемый компонент. Если это невозможно, результат следует описывать как сравнение систем, а не как причинный эффект одного механизма.

Такой подход защищает от распространённой ошибки: считать любую разницу между двумя harness чистым улучшением алгоритма. В агентных системах упаковка, планирование, контекст и backend являются частью поведения, поэтому их различия нельзя скрывать за одним итоговым числом.

Что меняет предыдущий эксперимент AVO с ядрами

В пакете упомянут отдельный предыдущий эксперимент AVO с ядрами. Он шёл семь дней, исследовал более 500 направлений и дал до 3,5% преимущества над cuDNN и до 10,5% над FlashAttention-4 в заявленных конфигурациях.

Этот результат помогает понять происхождение названия и инженерный профиль AVO: архитектура применялась не только к ARC-сценарию, но и к поиску вариантов в другой технической области. Однако его нельзя напрямую прибавлять к ARC-AGI-3 и нельзя использовать как независимое подтверждение 100% RHAE.

Факт: NVIDIA заявляла такие преимущества в отдельном эксперименте и в указанных конфигурациях.

Ограничение: в пакете нет основания считать эти проценты переносимыми на ARC-AGI-3, на Claude Opus 5 или на другой backend.

Интерпретация: общая тема двух экспериментов — не универсальная гарантия, а способность архитектуры организовывать поиск и итеративное улучшение. Для каждого домена всё равно требуется отдельная проверка, потому что различаются цель, среда, метрика и стоимость ошибки.

Что это меняет для разработчиков

Для разработчика главный вывод — перестать измерять агента только качеством финального текста. Если задача интерактивная, полезно собирать как минимум четыре группы показателей: успех, стоимость действий, устойчивость к ошибке и воспроизводимость.

Проектируйте контур, а не только prompt

Prompt остаётся частью конфигурации, но не исчерпывает её. Нужно отдельно проектировать представление наблюдения, память, правила извлечения, supervisor, инструменты, обработку feedback и recovery. Это не означает автоматически усложнять систему. Иногда дополнительный слой создаёт шум или расходует контекст. Его ценность должна подтверждаться абляцией.

Считайте стоимость взаимодействия

6 624 действия в заявленном прогоне — хороший пример того, что score и cost нужно публиковать вместе. Один агент может получить тот же результат большим числом проб, другой — меньшим количеством действий, но с более дорогим планированием. Поэтому одной метрики недостаточно: качество показывает, достигнута ли цель, а action count — какой интерактивный бюджет потребовался.

Отделяйте recovery от успеха с первой попытки

Агент, который умеет исправляться, и агент, который решает без ошибок, — разные системы. Recovery может быть практически полезным и одновременно менять интерпретацию score. В отчёте нужно показывать, сколько было первичных ошибок, сколько восстановлений, сколько повторов разрешено и входят ли они в общий бюджет.

Делайте память наблюдаемой

Persistent memory должна быть не просто фразой в архитектурной схеме. Разработчику важно знать, что сохраняется, когда запись обновляется, какие сведения извлекаются и не переносится ли информация из публичной настройки в оценку. Даже если внутренний формат памяти не раскрывается полностью, границы её действия должны быть задокументированы.

Архитектура, backend и метрика действий

Сравнение AVO и VISTA показывает, почему инфраструктурные различия нельзя отделять от результата. Backend определяет, как исполняется действие; representation — что именно видит модель; memory — какой прошлый контекст доступен; context management — как этот контекст помещается в рабочее окно. Изменение любого из этих элементов может сдвинуть score или action count.

В такой системе действие — не обязательно атомарная единица рассуждения. Его смысл задаётся правилами среды и учёта. Поэтому фраза «на 12% меньше действий» полезна только вместе с ответом на вопросы: одинаковы ли операции, одинаков ли лимит, одинаково ли засчитываются неудачные шаги и одинаково ли устроен backend.

Интерпретация. Агентные benchmark превращаются в оценку системы управления взаимодействием. Если два участника используют разные способы кодирования наблюдения и разные правила восстановления, сравнение их raw action count напоминает сравнение времени выполнения программ на разных машинах без описания компилятора.

Редакционная рекомендация: публиковать не одну строку с score, а профиль: RHAE, число окружений, число уровней, действия, модель, reasoning setting, representation, память, supervisor, recovery и статус проверки. Такой формат снижает риск рекламного прочтения и помогает воспроизводить полезные части результата.

Как читать self-reported benchmark

Self-reported не означает автоматически «неверный». Это означает, что источник утверждения и источник проверки совпадают или что независимая проверка не заявлена. В технологических исследованиях такие результаты могут быть ценными как ранний сигнал и как описание инженерной конфигурации, но уровень уверенности должен быть обозначен явно.

Для заявленного AVO-рекорда следует разделять три слоя:

  • Первичный источник: статья NVIDIA описывает архитектуру и результат, включая 100.00 RHAE, 25 окружений, 183 уровня и 6 624 действия.
  • Стандарт методики: ARC-AGI-3 Technical Report и Scoring Methodology описывают наборы и правила оценки.
  • Статус сообщества: community leaderboard обозначает публичные результаты как обычно self-reported.

Из этого следует корректная формула редакционного текста: «NVIDIA сообщила о…» или «в заявленной NVIDIA конфигурации…». Некорректная формула — «независимо доказано, что модель достигла…», если в источниках пакета нет такого подтверждения.

Что нас ждёт

Редакционный прогноз, а не установленный факт: по мере насыщения public set спор будет смещаться от крупного итогового процента к качеству протокола. Важнее станут controlled ablations, hidden evaluation, детализация памяти и сопоставимость action budget.

Первое направление — разделение benchmark-слоёв. Public set останется удобным для разработки и демонстрации, но private и semi-private режимы будут играть более важную роль в проверке переноса. Победный public score без hidden confirmation будет всё чаще восприниматься как промежуточная инженерная веха.

Второе — конкуренция harness. Разница между системами будет зависеть не только от базовой модели, но и от supervisor, memory policy, представления наблюдения, инструментов и восстановления. Это не отменяет значения моделей, но меняет единицу сравнения: фронтиром становится связка model plus environment interface plus control loop.

Третье — переход от одного score к профилю поведения. Разработчикам понадобится показывать стоимость действий, долю успешных восстановлений, устойчивость к изменению контекста и результаты на данных, которые не использовались при настройке. Иначе 100% будет сообщать о финише на публичной трассе, но мало — о способности ехать по новой.

Четвёртое — более строгая терминология вокруг AGI. Удачный результат на интерактивном benchmark может быть сильным свидетельством прогресса в одной форме обобщения, но не заменяет широкую программу проверки. Чем мощнее harness, тем важнее не скрывать его вклад за именем базовой модели.

Ограничения

  • Пакет содержит заявление NVIDIA о 100.00 RHAE, но не содержит независимого аудита этого результата.
  • Результат относится к public set, а не к semi-private или fully private competition sets.
  • Community leaderboard сообщает, что public-set результаты обычно self-reported; это нужно указывать рядом с рекордом.
  • Сравнение примерно с 30% относится к model-level configuration и не является прямой controlled ablation полного AVO system.
  • В сравнении с VISTA разница в 12% по действиям не изолирует вклад одного компонента: отличаются backend, representation, memory и context management.
  • Число 6 624 описывает действия заявленного прогона, но пакет не даёт полной раскладки по уровням и не доказывает оптимальность этого бюджета.
  • Текстовая сетка 64×64 без image tokens — характеристика конкретного ARC-представления, а не универсальное доказательство превосходства текста над изображениями.
  • Пакет не содержит достаточной информации, чтобы приписать точный вклад отдельно памяти, supervisor, инструментам или recovery.
  • Отдельный эксперимент с ядрами продолжался семь дней, исследовал более 500 направлений и дал заявленные преимущества над cuDNN и FlashAttention-4, но его нельзя переносить на ARC score без новых данных.
  • Один публичный benchmark не устанавливает AGI и не заменяет проверку на других задачах, интерфейсах и скрытых наборах.
  • Формула и правила RHAE должны сверяться с официальной методологией ARC Prize; в статье не следует подменять нормативный документ пересказом одного числа.

Итог ограничения: наиболее точное описание кейса — «NVIDIA заявила о полном public-set результате для Claude Opus 5 в системе AVO». Это сильное инженерное утверждение, но не универсальный сертификат модели или агента.

FAQ

Что именно NVIDIA назвала результатом 100%?

Компания сообщила о 100.00 RHAE на всех 25 публичных окружениях ARC-AGI-3 с Claude Opus 5 в AVO. В прогоне указаны 183 пройденных уровня и 6 624 действия среды.

Это результат Claude Opus 5 без дополнительных компонентов?

Нет. В заявленном описании участвовала полная агентная система AVO с persistent memory, supervisor, execution feedback, recovery и специальным представлением наблюдения как текстовой сетки 64×64 без image tokens.

Откуда взялось сравнение примерно с 30%?

NVIDIA сопоставляет свой system-level результат с примерно 30% для опубликованной ARC Prize model-level configuration. Это разные reasoning settings и разные уровни системы, поэтому сравнение не является чистым измерением прироста от одного компонента.

Что означает RHAE?

В этом контексте RHAE — метрика ARC-AGI-3, которая агрегирует результат по правилам benchmark. Точную формулу и правила scoring нужно сверять с официальной методологией ARC Prize.

Пройден ли private competition set?

Из переданного пакета этого не следует. Заявление NVIDIA относится к public set; semi-private и fully private competition sets нужно рассматривать отдельно.

Почему self-reported результат не равен независимой проверке?

Потому что self-reported означает, что результат заявлен участником, а независимый аудит в источниках не подтверждён. Community leaderboard отдельно указывает, что публичные результаты обычно имеют такой статус.

Почему 100% не доказывает AGI?

Score показывает работу конкретной связки модели, harness, интерфейса и benchmark на public set. Он не доказывает универсальное обобщение, перенос на скрытые среды или наличие всех свойств, которые обычно связывают с AGI.

Можно ли считать сравнение с VISTA доказательством превосходства AVO?

Можно говорить только о заявленном сравнении на 12% меньшего числа действий. Это не controlled ablation, потому что у систем различаются backend, representation, memory и context management.

Что нужно публиковать вместе с агентным score?

Минимально — набор оценки, статус self-reported или independently verified, модель и reasoning setting, описание harness, формат наблюдения, action budget, правила recovery и данные controlled ablation.

Источники

  1. NVIDIA AVO Reaches 100% on ARC-AGI-3 — первичный источник об архитектуре AVO, конфигурации с Claude Opus 5, 100.00 RHAE, 25 публичных окружениях, 183 уровнях и 6 624 действиях.
  2. AVO: Agentic Variation Operators for Autonomous Evolutionary Search — техническое описание AVO и контекст архитектуры Agentic Variation Operators.
  3. ARC-AGI-3 Technical Report — описание наборов данных и исследовательский контекст методики RHAE.
  4. ARC-AGI-3 Scoring Methodology — нормативная формула и правила scoring, по которым следует интерпретировать RHAE.
  5. ARC Prize 2026 — ARC-AGI-3 Competition — сведения о private evaluation и конкурсных требованиях.
  6. ARC-AGI Community Leaderboard — статус public-set результатов как обычно self-reported.
  7. VISTA: A Visual Harness for Reasoning in an Interactive World — сравниваемый harness, относительно которого в пакете указано сравнение по числу действий.
  8. Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3 — альтернативная архитектура агента и дополнительный исследовательский контекст для сравнения систем.
  9. How two settings tripled our ARC-AGI-3 scores — первичный пример влияния настроек harness и context management на ARC-AGI-3 score.

Метод чтения источников: заявления NVIDIA и OpenAI в статье обозначены как заявления компаний; технические отчёты и исследовательские работы используются для архитектурного и методологического контекста; leaderboard — для статуса публичной саморепортируемой оценки.