Запись архива

AI Index 2026: почему рост бенчмарков ещё не означает надёжный ИИ

Stanford AI Index 2026 фиксирует быстрый рост бенчмарков, но не подтверждает единую траекторию к надёжному «общему» ИИ. Разбираем мартовские snapshot-данные, августовские обновления ClockBench и OSWorld 2.0 и объясняем, почему capability, безопасность и внедрение нельзя сводить к одному проценту.

Схема с пятью осями AI Index 2026: capability, perception, long-horizon agency, safety reporting и deployment без общего суммарного балла

AI Index 2026 легко читать как набор рекордов: Stanford пишет, что лучший результат на Humanity’s Last Exam вырос на 30 процентных пунктов за год, а Gemini Deep Think набрал 35 баллов — уровень золота IMO 2025 — в пределах 4,5 часа. Но это не одна и та же система и не один и тот же тест: рядом с такими достижениями отчёт показывает, что на ClockBench мартовский лучший результат составлял 50,6% против 90,1% у людей.

Именно поэтому главный вывод отчёта на срез 13 августа 2026 года не в том, что ИИ движется по одной прямой к человеческому уровню вообще. Прогресс реален, но он остаётся jagged, то есть неровным по типам задач: сильный результат на сложном экзамене не превращается автоматически в надёжное восприятие, длинную агентную работу, безопасность и подтверждённый экономический эффект.

Коротко

  • AI Index 2026 — это не единый рейтинг интеллекта, а сборник разнородных измерений с разными датами среза, источниками и качеством данных.
  • В технической главе Stanford фиксирует ускорение: лучший результат на Humanity’s Last Exam вырос на 30 процентных пунктов за год, но сами бенчмарки быстрее стареют и чаще спорны по качеству.
  • ClockBench показывает типичную snapshot-decay: в мартовском срезе отчёта — 50,6% у лучшей системы и 90,1% у людей, а на текущей странице по состоянию на 13 августа — 66,7% и 90,7% соответственно.
  • Агентные результаты нельзя переносить в продакшен по одному числу: рост OSWorld до 66,3% в отчёте и только 20,6% binary completion на OSWorld 2.0 описывают разные задачи и разные протоколы.
  • Responsible AI по-прежнему измеряется хуже, чем capability: 362 против 233 записей в AI Incident Database — это число документированных кейсов, а не точная частота вреда.
  • Экономические headline-цифры тоже требуют расшифровки: 88% организаций сообщают об использовании AI хотя бы в одной функции, но масштабное внедрение агентных систем почти везде остаётся однозначным процентом.

Как читать 425-страничный AI Index 2026

AI Index 2026 объединяет девять глав: от R&D и технической производительности до экономики, политики и общественного мнения. Это важно, потому что внутри одного документа соседствуют benchmark results, survey-ответы, инвестиционные оценки и агрегированные базы инцидентов. Такие данные нельзя трактовать как одну шкалу готовности AI.

Для начала полезно различать три типа измерений. Snapshot — это фиксированный срез на конкретную дату, и технические таблицы в отчёте часто отражают март 2026 года. Benchmark измеряет поведение модели или системы в искусственно заданной задаче. Survey — это self-reported данные, где организации сами сообщают, что и как они внедряют.

Stanford сам предупреждает, что данные не указывают в одном направлении. Поэтому корректное чтение отчёта начинается не с вопроса «кто лидер», а с вопроса «что именно измерено, кем, когда и насколько это переносимо в реальную работу».

Headline Правильная интерпретация
+30 п.п. на HLE Быстрый рост capability на одном сложном тесте, но не доказательство общей надёжности.
66,7% на ClockBench Текущий результат страницы на 13 августа 2026 года, а не мартовский snapshot AI Index.
66,3% на OSWorld Успех на конкретном агентном бенчмарке и его протоколе, не production reliability.
362 AI incidents Количество документированных записей в базе, а не полная частота вреда.
88% организаций используют AI Self-reported использование хотя бы в одной функции, а не полная трансформация бизнеса.

Эта дисциплина особенно нужна там, где один и тот же отчёт содержит собственные внутренние расхождения. В AI Index 2026 они есть: на ClockBench Stanford одновременно показывает 50,1% и 50,6% в разных разделах, а по generative AI adoption — 70% и 79%. Скрывать такие различия нельзя, потому что именно они показывают, насколько осторожно нужно обращаться даже с авторитетным агрегатором.

Бенчмарки сгорают быстрее, чем успевают стать ориентиром

В технической главе Stanford пишет, что лучший результат на Humanity’s Last Exam вырос на 30 процентных пунктов за год. Это сильный сигнал: верхняя граница capability действительно смещается быстро. Но из этого не следует, что любая новая диаграмма автоматически становится хорошей линейкой для сравнения моделей на горизонте нескольких месяцев.

Проблема в том, что сами наборы задач могут быть шумными. Stanford ссылается на обзор девяти популярных наборов, где доля некорректных вопросов составляла от 2% на MMLU Math до 42% на GSM8K. Это не дефект всех бенчмарков и не повод объявлять любую оценку бесполезной, но это серьёзное предупреждение: при высокой плотности результатов спорные задания начинают заметно влиять на итоговый score.

Вторая проблема — адаптация под площадку. Stanford также отмечает исследования, где позиция в Arena может отражать не только общую способность системы, но и адаптацию к пользовательским предпочтениям самой площадки. Для попарного рейтинга это ожидаемо: Arena Elo измеряет предпочтения в конкретном интерфейсе и при конкретном потоке сравнений, а не точность, безопасность или устойчивость модели как таковые. Подробно об этом мы писали в разборе Chatbot Arena.

Отсюда практический вывод: бенчмарк может одновременно фиксировать реальный прогресс и быстро терять ценность как универсальный индикатор. Чем ближе тест к насыщению, тем больше разница в несколько пунктов зависит от качества датасета, формулировки промпта, harness, то есть оболочки запуска системы, и числа попыток. На похожую проблему нормировки и интерпретации стоит смотреть и в обзорах по SWE-bench Verified: показатель «почти 100%» в некоторых сводных диаграммах не означает raw pass rate, а относится к нормированной доле человеческого baseline.

Отдельно о Humanity’s Last Exam мы уже рассказывали в материале про HLE. В контексте AI Index 2026 это, вероятно, лучший пример того, как один впечатляющий рост не отменяет необходимость спрашивать о качестве набора, сроке годности результата и переносимости вывода за пределы самого теста.

ClockBench как кейс устаревания snapshot-данных

ClockBench полезен именно тем, что выглядит простой задачей: модель должна правильно читать время на аналоговых часах. На мартовском snapshot в подробной технической главе AI Index лучший результат составлял 50,6% у GPT-5.4 High против 90,1% у людей. При этом Stanford отдельно отмечает характер ошибок: когда модель ошибалась, отклонение измерялось часами, тогда как медианная человеческая ошибка измерялась минутами.

Здесь важно не потерять деталь. В обзорной странице Stanford фигурирует 50,1%, тогда как подробная глава и таблица дают 50,6%. Для статьи корректнее использовать 50,6% как значение из детализированного раздела и прямо отмечать внутреннее расхождение 50,1/50,6.

На 13 августа 2026 года картина уже другая: текущая страница ClockBench показывает 66,7% у GPT-5.6 Sol Max и 90,7% у человеческой базы. Это заметный рост после мартовского snapshot, но он не стирает разрыв. Более того, сам факт такого обновления показывает, насколько быстро устаревает фраза «лучшая модель» в ежегодном отчёте.

ClockBench важен не потому, что часы — главная бизнес-задача. Он важен как инженерный симптом: высокие результаты на сложных текстовых и олимпиадных тестах могут соседствовать с заметными провалами на визуальном восприятии и простом, но жёстко проверяемом интерфейсном действии. Это не парадокс одной модели, а пример неоднородности всей границы возможностей.

Агенты: рост виден, но длинный горизонт ломает простые выводы

В AI Index 2026 Stanford фиксирует рост OSWorld примерно с 12% до 66,3%. Это заметный прогресс в агентном бенчмарке компьютерного управления, где система должна взаимодействовать с интерфейсом, а не только выдавать текстовый ответ. Но называть этот результат production reliability нельзя: число относится к конкретному набору задач, конкретному harness и конкретному протоколу оценки.

Для агентных систем это особенно важно, потому что измеряется не только модель. Результат зависит от инструментов, памяти, ограничений на число шагов, правил ретраев и верификации финального состояния. Поэтому один и тот же языковой backbone может давать разный итог при другой оболочке запуска или другой схеме проверки.

После snapshot AI Index вышел OSWorld 2.0, и он резко усложняет картину. В версии arXiv v2 от 13 июля 2026 года описаны 108 длинных рабочих процессов, которые человеку занимают медианно около 1,6 часа. Claude Opus 4.7 в среднем использовал 318 tool calls против примерно 30 в OSWorld 1.0, а лучший результат по строгому binary completion при лимите 500 шагов составил 20,6% у Claude Opus 4.8; partial score достигал 54,8%.

Это не опровержение старого OSWorld и не прямое падение с 66,3% до 20,6%. Наборы задач, длина горизонта, лимиты и критерии успеха различаются, поэтому числа нельзя сравнивать по одной оси. Но вместе они показывают главное: короткий benchmark success не гарантирует удержание контекста, работу со скрытым состоянием, своевременное уточнение у пользователя и финальную проверку результата на длинной задаче. Подробнее мы разбирали это в материале об агентных бенчмарках.

Показателен и контраст внутри OSWorld 2.0. GPT-5.5 остановился примерно на 13% binary completion, хотя был экономнее по токенам. Это ещё раз показывает, что агентная эффективность — не одно число: качество, стоимость, латентность и устойчивость к сбою нужно рассматривать вместе, а не подменять всё средним score.

Responsible AI: то, что важнее всего для внедрения, измеряется хуже всего

Одна из самых важных линий AI Index 2026 проходит не через capability, а через дефицит измерений. Stanford пишет, что почти все ведущие разработчики публикуют capability-бенчмарки, тогда как отчётность по responsible AI остаётся разреженной. Это означает не то, что рисков обязательно стало больше, а то, что поле по-прежнему несоразмерно лучше умеет измерять силу системы, чем её ограничения и вред.

Самый частый пример неправильного чтения здесь — AI Incident Database. В выборке отчёта фигурируют 362 инцидента за 2025 год против 233 за 2024-й. Эти числа нельзя интерпретировать как точную частоту вреда и тем более как доказательство роста опасности ровно на 55%: AIID индексирует документированные публичные сообщения об ущербе и near-harm, объединяя публикации об одном событии, а итог зависит от масштаба применения AI, внимания СМИ и практики регистрации.

Именно поэтому корректнее говорить не об incidence rate, а о database count. На август 2026 года база продолжала обновляться и содержала более 1600 пронумерованных кейсов за всю историю, но даже это не превращает её в полный реестр всего вреда. Здесь действует механизм смещения наблюдения: чем выше интерес к теме и чем шире внедрение, тем больше шансов, что событие будет замечено, описано и занесено в базу.

В survey-части Stanford также отмечает рост выделенных ролей AI governance с 14% до 17% и снижение доли организаций без ответственного владельца с 9% до 5%. На странице highlights есть ещё один показатель: доля компаний без responsible AI policy снизилась с 24% до 11%, а главными барьерами названы нехватка знаний — 59%, бюджет — 48% и регуляторная неопределённость — 41%. Все эти проценты относятся к опросам, а не ко всем компаниям мира, и это принципиальная оговорка.

Если нужен более широкий контекст по тому, как field обсуждает риски, согласие и разногласия, полезен наш разбор International AI Safety Report. На его фоне AI Index 2026 показывает ту же проблему в прикладной форме: стандартизированная независимая отчётность отстаёт от темпа capability-гонки.

Экономика: 88% используют AI, но это не равно масштабному внедрению

Самая цитируемая цифра экономической главы — 88% организаций, которые self-reported регулярно используют AI хотя бы в одной бизнес-функции, против 78% годом ранее. Это сильный сигнал широкого распространения доступа к инструментам. Но это минимальный порог использования, а не доказательство того, что процессы уже перестроены, контроль налажен и эффект подтверждён на уровне бизнеса.

С generative AI внутри самого отчёта есть несогласованность. Подробная глава и Figure 4.3.1 дают 79% организаций, использующих generative AI хотя бы в одной функции, против 71% годом ранее, тогда как на странице highlights стоит 70%. В такой ситуации безопаснее делать главным числом именно 88%, потому что его подтверждает и первичный материал McKinsey State of AI 2025, а значение 79% нужно сопровождать прямой оговоркой о внутреннем расхождении 70/79.

Ещё важнее то, что Stanford пишет о масштабе агентного внедрения. Scaled agent deployment почти во всех функциях остаётся однозначным процентом. В technology sector показатели выше, но всё равно далеки от массовости: software engineering — 24%, IT — 22%, service operations — 21%.

Иначе говоря, headline adoption и operational scale — разные вещи. Компания может считать, что она использует AI, потому что сотрудники применяют инструменты хотя бы в одной функции, но это не означает, что критический workflow перепроектирован, SLA определены, а человек может надёжно выходить из контура только по исключениям.

Тот же принцип осторожности нужен и в инвестиционных цифрах. Stanford пишет о частных AI-инвестициях в США на уровне около 285,9 млрд долларов в 2025 году против 12,4 млрд долларов в Китае, но одновременно предупреждает, что такое сравнение недооценивает китайские государственные guidance funds. Поэтому эти значения годятся для описания частного капитала в доступной статистике, но не для окончательного вывода о полном инвестиционном разрыве.

На рынке труда картина тоже неоднородна. Около трети опрошенных организаций ожидают сокращения штата в следующем году, однако совокупные данные пока не показывают массового общего падения занятости. Это ещё один пример того, как локальные ожидания и макроэффекты нельзя подменять друг другом.

Продуктивность: почему проценты нельзя складывать в средний эффект AI

Экономическая глава перечисляет исследования, где AI повышал выпуск или скорость работы. Самые заметные цифры — около 14–15% задач в час в customer support, 26% pull requests у разработчиков с Copilot и 50% marketing output. Но эти результаты измеряют разное поведение, на разных задачах и в разных экспериментальных дизайнах, поэтому усреднять их в один показатель продуктивности нельзя.

Исследование Задача Метрика Почему не сравнивать напрямую
Исследование по customer support Работа операторов поддержки Около +14–15% задач в час Измеряется throughput в конкретном сервисном процессе, а не качество любой интеллектуальной работы.
Исследование по Copilot Разработка ПО +26% pull requests Метрика связана с конкретным инструментом и типом инженерного workflow, а не с общей производительностью программистов.
Исследование по marketing output Маркетинговое производство +50% output Output зависит от локального определения выпуска и не равен прибыли, качеству или долгосрочному эффекту.

На макроуровне сам отчёт осторожнее headline-цифр. Он перечисляет и положительные результаты, и нулевые эффекты, и риски learning penalties, когда помощь инструмента может ухудшать обучение или самостоятельное освоение навыка. Поэтому формула «AI повышает производительность на X%» по материалам AI Index 2026 просто не поддерживается.

Пять вопросов к любому AI-рекорду

Если вынести из AI Index 2026 один практический метод чтения новостей об ИИ, то это набор из пяти проверок. Они нужны не только для отчётов Stanford, но и для любого громкого пресс-релиза, leaderboard или демо.

  1. Какая дата среза? Мартовский snapshot и текущая страница leaderboard могут описывать уже разные поколения систем, как это видно по ClockBench.
  2. Каково качество датасета? Если обзор показывает от 2% до 42% некорректных вопросов в популярных наборах, то сам набор нужно обсуждать так же внимательно, как и модель.
  3. Что именно измерялось — модель, система или предпочтение пользователя? HLE, ClockBench, Arena Elo и OSWorld отвечают на разные вопросы и не сводятся к одной шкале.
  4. Сколько было попыток и как считался успех? Нужно различать single pass, pass@k, best-of-N, binary completion и partial score, иначе сравнение превращается в рекламную подмену.
  5. Насколько метрика связана с внедрением? Без данных о стоимости, задержке, доле ручных эскалаций и типах отказов benchmark result остаётся лабораторным ориентиром, а не эксплуатационной гарантией.

Такой список не отменяет ценность рекордов. Он просто возвращает им правильный статус: это сигнал о возможностях в конкретной постановке, а не универсальный KPI реального мира.

Что из этого следует дальше

Первая ожидаемая перемена — более короткая жизнь бенчмарков. Когда верхние результаты растут быстрее, annual snapshot хуже отражает текущее состояние field, и интерес смещается к live benchmarks и задачам, которые сложнее насытить за счёт короткого цикла релизов.

Вторая перемена — переход к system-level evaluation. Для агентов придётся отдельно измерять модель, инструменты, память, harness, число попыток и verifier, а не прятать всё в один итоговый score. Это уже видно по разрыву между OSWorld и OSWorld 2.0.

Третья перемена касается надёжности. Вместо одного среднего балла потребуются worst-case метрики, taxonomy отказов, стоимость, латентность и доля задач, где система всё ещё требует человека на критическом шаге. Иначе сравнение capability будет по-прежнему опережать понимание эксплуатационных ограничений.

Четвёртая перемена — догоняющая инфраструктура responsible AI. По логике AI Index 2026 полю нужны более стандартизированные disclosures, независимое incident reporting и внешняя проверка safety-утверждений. Быстро этот разрыв не исчезнет, но без него capability-диаграммы будут всё чаще отрываться от реальной управляемости систем.

Ограничения этого разбора

Этот текст сознательно держится только за данные и выводы, разрешённые факт-паком, и фиксирует срез на 13 августа 2026 года. Поэтому он не пытается достраивать картину сведениями вне AI Index 2026, указанных глав Stanford, ClockBench, OSWorld 2.0, McKinsey State of AI 2025 и AI Incident Database.

Даже в этих границах остаются ограничения. Часть показателей — self-reported survey, часть — мартовские snapshot-таблицы, а часть — быстро обновляющиеся внешние leaderboard и базы. Именно поэтому AI Index 2026 полезнее читать как атлас разнородных измерений, а не как один большой scorecard.

Вывод

AI Index 2026 фиксирует настоящее ускорение, но не подтверждает простую историю о равномерном приближении к надёжному универсальному ИИ. Capability растёт быстро, однако визуальное восприятие, длинный агентный горизонт, safety reporting и подтверждённый экономический эффект движутся в разном темпе.

Практический вывод для компаний и команд простой: тестировать системы на собственном workflow, а не покупать среднее обещание из headline-цифр. В 2026 году важнее не то, что модель показала на одном рекордном тесте, а то, сколько ошибок, задержек, ручных эскалаций и неожиданных сбоев остаётся в реальном процессе.

FAQ

Почему в статье есть и 50,6%, и 66,7% по ClockBench?

50,6% — это мартовский snapshot из подробной технической главы AI Index 2026, а 66,7% — текущее значение страницы ClockBench на 13 августа 2026 года. Это разные срезы, и их нельзя смешивать как один рекорд.

Почему нельзя говорить, что агенты уже надёжно выполняют две трети офисной работы?

Потому что 66,3% относится к OSWorld в конкретном benchmark-протоколе, а не к реальным офисным процессам вообще. Более длинный OSWorld 2.0 показывает совсем другую сложность и гораздо более низкий strict completion.

Означает ли рост AI incidents с 233 до 362, что риск вырос ровно на 55%?

Нет. Это число документированных записей в базе, а не полная частота вреда; на него влияют внедрение AI, внимание СМИ и правила регистрации событий.

Что на практике означает 88% организаций, использующих AI?

Это self-reported регулярное использование AI хотя бы в одной бизнес-функции. Показатель не равен масштабному внедрению агентных систем и не гарантирует доказанного экономического эффекта.

Почему нельзя усреднить +15%, +26% и +50% в одну цифру продуктивности?

Потому что это разные исследования с разными задачами, метриками и экспериментальными дизайнами. Они измеряют разные локальные эффекты, а не единый универсальный прирост производительности.

Источники

  • Stanford HAI — AI Index Report 2026: основная структура отчёта и навигация по главам.
  • Полный PDF AI Index 2026: мартовские snapshot-значения, HLE +30 п.п., ClockBench 50,6%, OSWorld 66,3%, экономика и продуктивность.
  • Technical Performance: сводные формулировки по benchmark-прогрессу, HLE, ClockBench и методологическим оговоркам.
  • ClockBench: текущий leaderboard на 13 августа 2026 года, 66,7% у лучшей системы и 90,7% у людей.
  • OSWorld 2.0: 108 long-horizon workflows, 1,6 часа человеку, 318 tool calls, 20,6% binary completion и 54,8% partial score.
  • Responsible AI: sparse benchmark reporting, 362 против 233 записей AIID и survey-показатели governance.
  • AI Incident Database: природа базы как реестра документированных кейсов, а не полной оценки incidence.
  • Economy: 88% использования AI хотя бы в одной функции, 79% generative AI в подробной главе и данные по scaled deployment.
  • McKinsey State of AI 2025: подтверждение headline adoption 88% и контекст перехода от пилотов к масштабу.

Связанные материалы