В материалах ICML 2024, проходившей 21–27 июля 2024 года, вышла позиционная статья Google DeepMind Position: Levels of AGI for Operationalizing Progress on the Path to AGI. Её задача не в том, чтобы объявить наступление AGI, а в том, чтобы дать рабочий язык для сравнения систем по широте задач, качеству выполнения и степени автономии.
Ниже — разбор именно версии ICML 2024 и близкой к ней arXiv v4 от 5 июня 2024 года. Это важно, потому что в arXiv v5 от 24 сентября 2025 года авторы переименовали Level 4 из Virtuoso в Exceptional; логика схемы сохранилась, но исторический контекст 2024 года лучше фиксировать отдельно.
Коротко
- DeepMind предлагает обсуждать AGI не как один магический порог, а как матрицу из двух осей: performance и generality.
- Перед матрицей авторы формулируют шесть принципов: фокус на способностях, а не на механизме; на generality и performance; на когнитивных и метакогнитивных, а не физических задачах; на потенциале, а не deployment; на ecological validity; и на пути к AGI, а не на единственной финальной точке.
- В версии ICML 2024 есть пять уровней performance выше нуля: Emerging, Competent, Expert, Virtuoso, Superhuman. В текущей arXiv-версии название Virtuoso заменено на Exceptional.
- Автономность вынесена в отдельную шкалу: мощная система не обязана быть агентом. Один и тот же capability-профиль можно развернуть как tool, consultant или agent.
- Главное ограничение схемы: это онтология, а не готовый benchmark. Статья не даёт окончательного набора задач и не фиксирует точный процент тестов, который должен пройти «общий» ИИ.
Контекст: зачем вообще понадобились уровни AGI
Проблема, с которой начинают авторы, проста: термин AGI используется слишком широко. Одни имеют в виду прохождение варианта теста Тьюринга, другие — замену человека в экономически ценной работе, третьи — способность учиться новым задачам, четвёртые — уже почти любой сильный large language model.
В статье разбираются девять характерных определений и соседних рамок: от теста Тьюринга и «strong AI» до формулировок OpenAI, Гэри Маркуса и Мустафы Сулеймана. Из этого обзора DeepMind делает важный практический вывод: спор об AGI часто смешивает как минимум три разные вещи — насколько хорошо система решает задачи, насколько широк спектр этих задач и насколько автономно система действует в реальном контексте.
Для инженера или продуктовой команды это не академическая мелочь. Если не разделять эти измерения, легко поставить рядом AlphaGo, ChatGPT, автопилот, робота-манипулятора и поисковый движок и назвать всё это «движением к AGI», хотя риски, интерфейсы и критерии качества у них разные.
Метод: как устроена схема Levels of AGI
Шесть принципов
Сначала DeepMind предлагает не саму таблицу уровней, а шесть принципов, которым, по мнению авторов, должно соответствовать полезное определение AGI.
- Capabilities, not processes. Важно, что система умеет делать, а не обязана ли она мыслить «как человек».
- Generality and performance. Широта без качества недостаточна, но и качество на одной узкой задаче не делает систему общей.
- Cognitive and metacognitive, not physical tasks. В центр ставятся не-физические когнитивные задачи и метакогнитивные навыки вроде обучения новым навыкам или умения просить помощь.
- Potential, not deployment. AGI предлагается определять по способности, а не по факту массового внедрения.
- Ecological validity. Бенчмарки должны быть ближе к реальным задачам, а не только к удобным игрушечным тестам.
- Path, not single endpoint. Нужна шкала прогресса, а не бинарный ответ «AGI / не AGI».
Это очень похоже на то, как в автомобильной индустрии прижились уровни автоматизации SAE J3016. DeepMind прямо ссылается на эту аналогию: сначала нужен общий словарь, а уже потом — точные регуляторные и инженерные процедуры.
Две оси и отдельная шкала автономности
Сама матрица строится по двум осям. Первая — performance, то есть глубина способностей: насколько хорошо система выполняет задачу относительно людей. Вторая — generality, то есть широта: на каком диапазоне задач система достигает нужного уровня качества.
По оси generality у DeepMind две большие категории. Narrow — это ясно ограниченная задача или небольшой набор задач. General — широкий спектр не-физических задач, включая метакогнитивные навыки вроде освоения новых умений.
Отдельно от capability-матрицы авторы вводят шесть Levels of Autonomy: от No AI и AI as a Tool до AI as an Agent. Ключевая мысль здесь в том, что более высокий capability лишь «открывает возможность» более высокой автономности, но не предписывает её. Сильную модель можно оставить инструментом в руках человека, и это может быть осознанным решением по безопасности.
Результаты: какие уровни предлагает DeepMind
Ниже — компактная версия таблицы из статьи. Важно помнить два условия авторов: примеры систем в ячейках являются приблизительными, а однозначная классификация потребует стандартизированного benchmark, которого в статье ещё нет.
| Уровень | Порог по performance | Примеры narrow AI в статье | Статус general AI в статье |
|---|---|---|---|
| Level 0: No AI | ИИ нет | Калькулятор, компилятор | General Non-AI, например human-in-the-loop workflows |
| Level 1: Emerging | На уровне или немного лучше неквалифицированного человека | Простые rule-based systems, ранний GOFAI | Emerging AGI; по исторической оценке авторов сюда относились frontier LLM по состоянию на сентябрь 2023 года |
| Level 2: Competent | Не ниже 50-го перцентиля skilled adults | Toxicity detectors, smart speakers, отдельные VQA-системы, SOTA LLM на части задач | Competent AGI; в статье прямо сказано, что публично не достигнут |
| Level 3: Expert | Не ниже 90-го перцентиля skilled adults | Grammarly, генеративные image models уровня DALL·E 2 и Imagen | Expert AGI; не достигнут |
| Level 4: Virtuoso | Не ниже 99-го перцентиля skilled adults | Deep Blue, AlphaGo | Virtuoso AGI; не достигнут |
| Level 5: Superhuman | Выше 100% людей в задаче | AlphaFold, AlphaZero, Stockfish | Artificial Superintelligence; не достигнут |
Здесь есть два особенно важных нюанса. Во-первых, general system может иметь неровный профиль: быть в среднем Level 1, но на части задач тянуть на Level 2 или Level 3. Во-вторых, Competent AGI для авторов — это не красивая метафора, а достаточно жёсткий порог: не эпизодические удачные ответы, а performance не ниже 50-го перцентиля skilled adults на большинстве когнитивных задач.
Поэтому статья сознательно не называет тогдашние frontier LLM полноценным AGI. В версии ICML 2024 и arXiv v4 авторы пишут, что такие модели, как ChatGPT, Bard, Llama 2 и Gemini, по состоянию на сентябрь 2023 года лучше описывать как Level 1 General AI, то есть Emerging AGI. Это историческая оценка из самой статьи, а не утверждение про модели августа 2026 года.
Отдельная шкала autonomy выглядит так:
- Level 0: No AI.
- Level 1: AI as a Tool.
- Level 2: AI as a Consultant.
- Level 3: AI as a Collaborator.
- Level 4: AI as an Expert.
- Level 5: AI as an Agent.
Для практики это означает, что обсуждать риск нужно не только по capability, но и по интерфейсу использования. По логике статьи одна и та же модель может быть относительно безопасным редактором текста в режиме tool и куда более рискованной системой в режиме agent.
Интерпретация
Наш комментарий
На наш взгляд, ценность работы не в том, что она «измерила путь к AGI», а в том, что она разрезала разговор на три вопроса, которые обычно путают. Что система умеет? Насколько хорошо она это делает относительно людей? Как именно мы позволяем ей действовать в продукте или в организации?
Для practitioners это полезно как минимум в трёх местах. Первое — в model cards и evaluation reports: вместо расплывчатого «модель очень общая» можно отдельно описывать breadth, depth и тип автономности. Второе — в product review: система поддержки кодинга и полностью автономный software agent не должны проходить одну и ту же risk-рамку. Третье — в коммуникации с бизнесом и регуляторами: слово AGI можно не запрещать, но нужно перестать использовать его как односложный ярлык.
Ещё одна сильная сторона рамки — отказ от идеи, будто AGI обязательно совпадает с робототехникой или полной автономией. Это делает схему удобной для анализа именно современных foundation models, у которых cognitive capability часто растёт быстрее, чем физическое воплощение.
Ограничения и критика
Самое серьёзное ограничение работа формулирует сама: это не benchmark. Авторы прямо пишут, что не задают окончательный набор задач и не хотят пока фиксировать точную долю тестов, достаточную для статуса General AI данного уровня. То есть схема задаёт язык измерения, но ещё не даёт измерительный прибор.
Второе ограничение — трудность самих human-relative порогов. Перцентиль skilled adults звучит строго, но в реальной оценке быстро возникают вопросы: кого брать за skilled adults в программировании, письме, диагностике, обучении, переговорах? как сравнивать качество на задачах с разной стоимостью ошибки? и что делать с tool use, когда и человек, и модель работают не «в чистом виде», а с дополнительными системами?
Третье ограничение — историческая и приблизительная природа примеров. Сами авторы подчёркивают, что размещение систем по ячейкам примерное. Поэтому таблицу нельзя читать как живой leaderboard: это не сертификация ChatGPT, Gemini или AlphaFold, а иллюстрация того, как могла бы работать онтология.
Четвёртое — сознательное исключение физических задач из ядра определения. Для части исследователей это плюс, потому что позволяет обсуждать AGI без обязательной робототехники. Для другой части — минус, потому что embodiment может быть существенным для реального обобщения и освоения мира.
Наконец, есть и внешняя критика более общего рода. Франсуа Шолле в On the Measure of Intelligence давно спорит с оценкой интеллекта через skill на уже заданных задачах и настаивает на skill-acquisition efficiency, priors и generalization difficulty. А авторы Position: Stop Making Unscientific AGI Performance Claims предупреждают, что в среде LLM легко переинтерпретировать отдельные впечатляющие результаты как доказательство общего интеллекта. На этом фоне схема DeepMind выглядит полезной, но всё ещё предварительной: она снижает путаницу, однако сама по себе не решает вопроса валидного измерения general intelligence.
Итог
Levels of AGI — это не доказательство того, что мы близко или далеко от AGI, а попытка ввести более аккуратный словарь. Главная идея проста: общность, качество и автономность нужно разносить по разным осям. Если запомнить только одно, то вот оно: сильная узкая система, широкая, но неровная система и полностью автономный агент — это три разных инженерных и регуляторных объекта, даже если в публичной дискуссии их часто называют одним словом.
Источники
- Position: Levels of AGI for Operationalizing Progress on the Path to AGI — публикация в материалах ICML 2024, фиксирует статус работы как position paper и даты конференции.
- Position: Levels of AGI for Operationalizing Progress on the Path to AGI — версия, близкая к ICML 2024, с таблицами уровней, исторической терминологией Virtuoso и примерами систем.
- Levels of AGI for Operationalizing Progress on the Path to AGI — текущая arXiv-страница со submission history и примечанием о переименовании Level 4 в Exceptional в версии v5.
- Levels of AGI for Operationalizing Progress on the Path to AGI — Google DeepMind — официальная страница публикации Google DeepMind с датой размещения и кратким описанием рамки.
- Taxonomy and Definitions for Terms Related to Driving Automation Systems for On-Road Motor Vehicles – Recommended Practice — официальный стандарт SAE J3016, на который DeepMind опирается как на аналогию для уровней автоматизации.
- On the Measure of Intelligence — важная альтернативная рамка, критикующая оценку интеллекта только по навыку на фиксированных задачах.
- Position: Stop Making Unscientific AGI Performance Claims — внешняя критика завышенных AGI-claim’ов и антропоморфизации результатов LLM.
FAQ
Это определение AGI или просто удобная классификация?
Скорее второе. Статья предлагает операциональную онтологию для обсуждения прогресса, а не финальное философское определение интеллекта.
DeepMind считает ChatGPT и похожие модели AGI?
В исторической рамке статьи — нет в сильном смысле. По оценке авторов, frontier LLM по состоянию на сентябрь 2023 года лучше относить к Level 1 General AI, то есть к Emerging AGI.
Почему автономность вынесена отдельно от уровня AGI?
Потому что capability и deployment — не одно и то же. Система может быть очень сильной, но использоваться как инструмент под плотным человеческим контролем.
Можно ли уже сегодня измерить любой frontier model по этой шкале?
Не строго. Для этого нужен согласованный living benchmark с реальными задачами и понятной процедурой сравнения с людьми, а статья такого benchmark ещё не даёт.
