Запись архива

Humanity’s Last Exam: что реально измеряет «экзамен на пределе знаний»

Разбираем Humanity’s Last Exam — бенчмарк CAIS и Scale AI для закрытых вопросов экспертного уровня. Что в нём меряют, почему первые модели застряли ниже 10% и где у HLE сильные стороны и ограничения.

Схема пайплайна Humanity’s Last Exam: фильтрация вопросов через frontier-модели, экспертное ревью, публичный набор HLE и оценка ответов judge-моделью

Humanity’s Last Exam, или HLE, — это бенчмарк от Center for AI Safety и Scale AI, впервые выложенный на arXiv 24 января 2025 года и затем зафиксированный в финальной публичной версии 3 апреля 2025 года. В peer-reviewed форме он вышел в Nature 28 января 2026 года уже как набор из 2,500 задач. Идея HLE проста: если старые академические тесты быстро насыщаются, нужен более жёсткий экзамен, где вопросы составляют эксперты, ответы остаются закрытыми и автоматически проверяемыми, а сами задачи трудно «вытянуть» простым поиском.

Для практиков HLE важен не как очередной громкий рейтинг, а как попытка померить предел широких академических знаний и рассуждения у frontier-моделей. На старте проекта, по официальному анонсу Scale AI от 23 января 2025 года и arXiv-версии статьи от 24 января 2025 года, ни одна из протестированных моделей не превысила 10% точности.

Коротко

  • HLE задуман как широкий закрытый бенчмарк экспертного уровня: не только математика или код, а более 100 дисциплин в одном наборе.
  • Исторически важно различать версии: в январе 2025 года HLE анонсировали как набор из 3,000 вопросов, а после bug bounty и чистки 3 апреля 2025 года финальная публичная версия стала набором из 2,500 вопросов.
  • Низкие результаты на HLE частично «встроены» в саму конструкцию теста: в датасет старались пропускать вопросы, на которых frontier-модели уже ошибались.
  • Официальные результаты показывают не только низкую точность, но и слабую калибровку: модели часто отвечают неверно с высокой уверенностью.
  • HLE полезен как стресс-тест закрытых академических задач, но сам по себе не измеряет агентность, качество tool use, исследовательскую автономность или «AGI».

Контекст: зачем вообще понадобился Humanity’s Last Exam

Авторы HLE запускали проект как ответ на насыщение старых тестов. И в arXiv-версии 2025 года, и в статье Nature 2026 года они пишут, что многие популярные академические бенчмарки уже плохо различают frontier-модели, потому что результаты там приближаются к потолку.

Отсюда и ключевой замысел HLE: не углубиться в одну узкую область, а собрать широкий набор закрытых задач экспертного уровня. Это отличает HLE от более специализированных тестов вроде чисто математических или сугубо scientific-QA наборов. В этом смысле HLE — попытка сделать «MMLU после насыщения», но с более высокой сложностью, мультимодальностью и более жёстким отбором вопросов.

Важно и историческое уточнение. В ранней arXiv-версии от 24 января 2025 года HLE описывался как набор из 3,000 вопросов. После публичного периода обратной связи, bug bounty и удаления проблемных или слишком легко находимых задач официальный сайт проекта зафиксировал 3 апреля 2025 года финальную публичную версию уже на 2,500 вопросах; именно эту версию затем описывает статья в Nature.

Метод: как устроен HLE

Сбор вопросов

По данным официального сайта HLE и статьи Nature, в проекте участвовали почти 1,000 профильных контрибьюторов из более чем 500 организаций и 50 стран. Это не выглядит как обычный маленький «ручной» eval: масштаб нужен был именно для ширины дисциплин.

Во Nature-версии авторы отдельно пишут, что вопросы обычно требуют graduate-level подготовки или очень специфического знания. Форматы — короткий точный ответ и multiple choice. Там же указано, что около 14% задач требуют совместно понимать текст и изображение, а 24% — это multiple-choice; остальная часть — exact-match.

Фильтрация по текущим моделям

Критически важная деталь для интерпретации результатов: HLE не является «случайной выборкой» реальных академических вопросов. В arXiv-версии и затем в Nature авторы описывают пайплайн, где вопросы сначала прогоняются через frontier-модели. Если модели уже умеют отвечать, вопрос обычно не проходит дальше. Иными словами, HLE по конструкции стремится отбирать то, что текущие модели ломает.

В статье Nature сказано, что в ходе отбора было зафиксировано более 70,000 попыток решения, а примерно 13,000 вопросов, на которых модели споткнулись, ушли на экспертное ревью. В ранней arXiv-версии эта же логика описана почти дословно. Это один из главных источников сложности HLE — и одновременно причина, почему абсолютные проценты здесь нельзя читать как «оценку за экзамен» в школьном смысле.

Двухэтапное ревью и приватный holdout

После LLM-фильтрации вопросы проходили человеческую проверку и доработку. Во Nature описаны два раунда ревью: сначала несколько graduate-level reviewers, потом подтверждение организаторами или экспертами, обученными по их рубрике. Кроме публичного набора, авторы оставили и приватный holdout-набор, чтобы хотя бы частично отслеживать переобучение и gaming после публикации.

Как считается результат

На HLE модель должна не просто дать ответ, но и указать уверенность. В методах Nature формализован формат ответа вида:

Explanation: ...
Answer: ...
Confidence: 0-100%

Дальше вступает judge-модель. На официальном сайте HLE указано, что для опубликованных результатов используется judge model o3-mini; в методах Nature уточняется версия o3-mini-2025-01-31 со structured decoding. Judge извлекает финальный ответ, сравнивает его с эталоном и отдельно считает калибровку уверенности.

Для практиков это важный технический нюанс: HLE — не просто таблица accuracy. Это ещё и оценка того, насколько модель понимает границы собственной компетентности.

Результаты: что показал HLE

Первый headline проекта был жёстким: на анонсе 23 января 2025 года все протестированные frontier-модели оставались ниже 10% точности. После финализации публичного набора и публикации в Nature авторы показали более поздние официальные результаты на версии датасета от 3 апреля 2025 года. Ниже — только те строки, которые совпадают между статьёй Nature и официальным сайтом HLE.

Модель Точность HLE, % Calibration error, % Статус сравнения
GPT-4o 2.7 ± 0.6 89 базовый официальный результат
o1 8.0 ± 1.1 83 базовый официальный результат
DeepSeek-R1* 8.5 ± 1.2 73 базовый официальный результат
Gemini 2.5 Pro 21.6 ± 1.6 72 post-release
GPT-5 25.3 ± 1.7 50 post-release

* DeepSeek-R1 в официальных материалах отмечен как не-мультимодальный и потому оценён только на text-only subset. В Nature post-release модели вынесены отдельно, потому что после открытия HLE разработчики уже имели доступ к публичному датасету.

Здесь есть два практических вывода. Во-первых, HLE действительно оказался «долгоиграющим» тестом: даже спустя месяцы после релиза официальные результаты на финальной публичной версии остаются далеки от насыщения. Во-вторых, рост accuracy сопровождается существенными различиями по калибровке: даже при лучшей точности модель может оставаться плохо откалиброванной, а значит — уверенно ошибаться там, где задача выходит за её реальную компетенцию.

Ещё один нюанс из самой статьи Nature: авторы специально предупреждают, что маленькие сдвиги около нуля не стоит переинтерпретировать. Для HLE это важно, потому что часть точности возле нижней границы может объясняться угадыванием, особенностями multiple-choice-поднабора и шумом инференса.

Что это значит на практике

Если убрать шум вокруг громкого названия, HLE измеряет довольно конкретную вещь: как модель справляется с широким набором закрытых, трудноизвлекаемых и часто очень специализированных академических задач, когда от неё требуется не только ответ, но и заявленная уверенность. Это полезно, если вы сравниваете reasoning-модели, строите собственные evals для «редких трудных случаев» или хотите тестировать не только correctness, но и calibration.

Но HLE плохо подходит как единый ответ на вопрос «какая модель лучше для моего продукта». Он почти ничего не говорит о tool use, длительных агентных траекториях, инженерных workflow, поиске по документации, RAG-пайплайнах, UI-автоматизации или надёжности в многошаговом окружении. Это важный академический стресс-тест, а не универсальный procurement score.

Наш комментарий

На наш взгляд, HLE особенно полезен не там, где вы хотите выбрать «победителя leaderboard», а там, где вам нужен верхний слой трудности для внутренней диагностики. Если модель выигрывает у другой на обычных продуктовых задачах, но разваливается на HLE-подобных вопросах, это сигнал о хрупкости её длинного рассуждения, узкой специализации или плохой самооценке уверенности.

При этом рост результатов post-release нужно читать осторожно. Он может означать и реальные улучшения в reasoning, и лучшее использование test-time compute, и частичное влияние публичности самого бенчмарка. Поэтому HLE хорош как индикатор направления, но не как окончательный судья прогресса.

Ограничения и критика

1. Сложность здесь частично сконструирована. HLE специально отбирает задачи, которые уже валят текущие модели. Это делает тест полезным для frontier-оценки, но менее «естественным» как срез реальных пользовательских запросов. Именно поэтому низкий процент на HLE нельзя напрямую переводить в бытовое «модель знает лишь четверть материала».

2. Публичность создаёт риск контаминации. В Nature авторы отдельно отделяют post-release модели, потому что после open-source релиза разработчики уже могли видеть публичные вопросы. Официальный GitHub-репозиторий HLE даже содержит canary string и прямое предупреждение, что данные бенчмарка не должны попадать в training corpora.

3. У качества разметки были реальные проблемы. Официальный проект открыл bug bounty 11 февраля 2025 года, закрыл его 21 марта 2025 года, а 3 апреля 2025 года зафиксировал финальную версию из 2,500 вопросов после удаления или замены части проблемных задач. В статье Nature авторы оценивают disagreement rate экспертов на публичном наборе в 15.4%. Отдельная работа HLE-Verified от 15 февраля 2026 года идёт дальше: по её данным, систематическая верификация и ремонт задач повышают среднюю точность семи моделей на 7–10 процентных пунктов. Это сильный сигнал, что исходный HLE полезен, но не безошибочен как измерительный прибор.

4. HLE не равен «AGI-тесту». И официальный сайт, и статья Nature прямо говорят, что высокий результат на HLE не означает автономные исследовательские способности или общий интеллект. Это закрытый академический benchmark, а не тест на реальную долгую работу в среде.

5. Покрытие не идеально сбалансировано. В Nature авторы отмечают более сильную представленность математики и STEM-направлений. Кроме того, в доступных первичных материалах нет единого агрегированного human baseline для всей HLE, поэтому сравнение «модель против человека» остаётся скорее качественным, чем аккуратно измеренным числом.

Вывод

Humanity’s Last Exam — это важный и, по меркам публичных academic evals, довольно честный шаг вперёд: широкий, закрытый, сложный и калибровочно-чувствительный тест, который действительно дольше старых наборов сопротивлялся насыщению. Но его нужно читать как инструмент для frontier-диагностики, а не как окончательный рейтинг «кто умнее».

Если запомнить одну мысль, то вот она: HLE ценен не громким названием, а тем, что показывает пределы моделей там, где им приходится отвечать на узкие экспертные вопросы и при этом признавать или не признавать собственную неуверенность.

Источники

FAQ

HLE проверяет знания или рассуждение?

И то и другое, но только в формате закрытых задач. Вопросы специально стараются сделать трудными для простого retrieval, а модели дополнительно обязаны указывать уверенность в ответе.

Почему низкий процент на HLE не означает, что модель «ничего не знает»?

Потому что HLE отбирался именно как набор задач, которые уже ломали frontier-модели. Это не случайный экзамен из учебника, а специально сконструированный stress test.

Можно ли по HLE выбирать модель для продукта?

Только частично. HLE полезен как верхний слой сложности и тест на calibration, но его нужно дополнять своими evals на реальных задачах: tool use, RAG, код, latency, стоимость и отказоустойчивость.

Чем HLE-Verified отличается от исходного HLE?

HLE-Verified не придумывает новый тип задач, а систематически проверяет и при необходимости исправляет существующие вопросы и эталоны ответов. Это попытка сделать измерение на HLE более надёжным.

Читайте также