Humanity’s Last Exam, или HLE, — это бенчмарк от Center for AI Safety и Scale AI, впервые выложенный на arXiv 24 января 2025 года и затем зафиксированный в финальной публичной версии 3 апреля 2025 года. В peer-reviewed форме он вышел в Nature 28 января 2026 года уже как набор из 2,500 задач. Идея HLE проста: если старые академические тесты быстро насыщаются, нужен более жёсткий экзамен, где вопросы составляют эксперты, ответы остаются закрытыми и автоматически проверяемыми, а сами задачи трудно «вытянуть» простым поиском.
Для практиков HLE важен не как очередной громкий рейтинг, а как попытка померить предел широких академических знаний и рассуждения у frontier-моделей. На старте проекта, по официальному анонсу Scale AI от 23 января 2025 года и arXiv-версии статьи от 24 января 2025 года, ни одна из протестированных моделей не превысила 10% точности.
Коротко
- HLE задуман как широкий закрытый бенчмарк экспертного уровня: не только математика или код, а более 100 дисциплин в одном наборе.
- Исторически важно различать версии: в январе 2025 года HLE анонсировали как набор из 3,000 вопросов, а после bug bounty и чистки 3 апреля 2025 года финальная публичная версия стала набором из 2,500 вопросов.
- Низкие результаты на HLE частично «встроены» в саму конструкцию теста: в датасет старались пропускать вопросы, на которых frontier-модели уже ошибались.
- Официальные результаты показывают не только низкую точность, но и слабую калибровку: модели часто отвечают неверно с высокой уверенностью.
- HLE полезен как стресс-тест закрытых академических задач, но сам по себе не измеряет агентность, качество tool use, исследовательскую автономность или «AGI».
Контекст: зачем вообще понадобился Humanity’s Last Exam
Авторы HLE запускали проект как ответ на насыщение старых тестов. И в arXiv-версии 2025 года, и в статье Nature 2026 года они пишут, что многие популярные академические бенчмарки уже плохо различают frontier-модели, потому что результаты там приближаются к потолку.
Отсюда и ключевой замысел HLE: не углубиться в одну узкую область, а собрать широкий набор закрытых задач экспертного уровня. Это отличает HLE от более специализированных тестов вроде чисто математических или сугубо scientific-QA наборов. В этом смысле HLE — попытка сделать «MMLU после насыщения», но с более высокой сложностью, мультимодальностью и более жёстким отбором вопросов.
Важно и историческое уточнение. В ранней arXiv-версии от 24 января 2025 года HLE описывался как набор из 3,000 вопросов. После публичного периода обратной связи, bug bounty и удаления проблемных или слишком легко находимых задач официальный сайт проекта зафиксировал 3 апреля 2025 года финальную публичную версию уже на 2,500 вопросах; именно эту версию затем описывает статья в Nature.
Метод: как устроен HLE
Сбор вопросов
По данным официального сайта HLE и статьи Nature, в проекте участвовали почти 1,000 профильных контрибьюторов из более чем 500 организаций и 50 стран. Это не выглядит как обычный маленький «ручной» eval: масштаб нужен был именно для ширины дисциплин.
Во Nature-версии авторы отдельно пишут, что вопросы обычно требуют graduate-level подготовки или очень специфического знания. Форматы — короткий точный ответ и multiple choice. Там же указано, что около 14% задач требуют совместно понимать текст и изображение, а 24% — это multiple-choice; остальная часть — exact-match.
Фильтрация по текущим моделям
Критически важная деталь для интерпретации результатов: HLE не является «случайной выборкой» реальных академических вопросов. В arXiv-версии и затем в Nature авторы описывают пайплайн, где вопросы сначала прогоняются через frontier-модели. Если модели уже умеют отвечать, вопрос обычно не проходит дальше. Иными словами, HLE по конструкции стремится отбирать то, что текущие модели ломает.
В статье Nature сказано, что в ходе отбора было зафиксировано более 70,000 попыток решения, а примерно 13,000 вопросов, на которых модели споткнулись, ушли на экспертное ревью. В ранней arXiv-версии эта же логика описана почти дословно. Это один из главных источников сложности HLE — и одновременно причина, почему абсолютные проценты здесь нельзя читать как «оценку за экзамен» в школьном смысле.
Двухэтапное ревью и приватный holdout
После LLM-фильтрации вопросы проходили человеческую проверку и доработку. Во Nature описаны два раунда ревью: сначала несколько graduate-level reviewers, потом подтверждение организаторами или экспертами, обученными по их рубрике. Кроме публичного набора, авторы оставили и приватный holdout-набор, чтобы хотя бы частично отслеживать переобучение и gaming после публикации.
Как считается результат
На HLE модель должна не просто дать ответ, но и указать уверенность. В методах Nature формализован формат ответа вида:
Explanation: ... Answer: ... Confidence: 0-100%
Дальше вступает judge-модель. На официальном сайте HLE указано, что для опубликованных результатов используется judge model o3-mini; в методах Nature уточняется версия o3-mini-2025-01-31 со structured decoding. Judge извлекает финальный ответ, сравнивает его с эталоном и отдельно считает калибровку уверенности.
Для практиков это важный технический нюанс: HLE — не просто таблица accuracy. Это ещё и оценка того, насколько модель понимает границы собственной компетентности.
Результаты: что показал HLE
Первый headline проекта был жёстким: на анонсе 23 января 2025 года все протестированные frontier-модели оставались ниже 10% точности. После финализации публичного набора и публикации в Nature авторы показали более поздние официальные результаты на версии датасета от 3 апреля 2025 года. Ниже — только те строки, которые совпадают между статьёй Nature и официальным сайтом HLE.
| Модель | Точность HLE, % | Calibration error, % | Статус сравнения |
|---|---|---|---|
| GPT-4o | 2.7 ± 0.6 | 89 | базовый официальный результат |
| o1 | 8.0 ± 1.1 | 83 | базовый официальный результат |
| DeepSeek-R1* | 8.5 ± 1.2 | 73 | базовый официальный результат |
| Gemini 2.5 Pro | 21.6 ± 1.6 | 72 | post-release |
| GPT-5 | 25.3 ± 1.7 | 50 | post-release |
* DeepSeek-R1 в официальных материалах отмечен как не-мультимодальный и потому оценён только на text-only subset. В Nature post-release модели вынесены отдельно, потому что после открытия HLE разработчики уже имели доступ к публичному датасету.
Здесь есть два практических вывода. Во-первых, HLE действительно оказался «долгоиграющим» тестом: даже спустя месяцы после релиза официальные результаты на финальной публичной версии остаются далеки от насыщения. Во-вторых, рост accuracy сопровождается существенными различиями по калибровке: даже при лучшей точности модель может оставаться плохо откалиброванной, а значит — уверенно ошибаться там, где задача выходит за её реальную компетенцию.
Ещё один нюанс из самой статьи Nature: авторы специально предупреждают, что маленькие сдвиги около нуля не стоит переинтерпретировать. Для HLE это важно, потому что часть точности возле нижней границы может объясняться угадыванием, особенностями multiple-choice-поднабора и шумом инференса.
Что это значит на практике
Если убрать шум вокруг громкого названия, HLE измеряет довольно конкретную вещь: как модель справляется с широким набором закрытых, трудноизвлекаемых и часто очень специализированных академических задач, когда от неё требуется не только ответ, но и заявленная уверенность. Это полезно, если вы сравниваете reasoning-модели, строите собственные evals для «редких трудных случаев» или хотите тестировать не только correctness, но и calibration.
Но HLE плохо подходит как единый ответ на вопрос «какая модель лучше для моего продукта». Он почти ничего не говорит о tool use, длительных агентных траекториях, инженерных workflow, поиске по документации, RAG-пайплайнах, UI-автоматизации или надёжности в многошаговом окружении. Это важный академический стресс-тест, а не универсальный procurement score.
Наш комментарий
На наш взгляд, HLE особенно полезен не там, где вы хотите выбрать «победителя leaderboard», а там, где вам нужен верхний слой трудности для внутренней диагностики. Если модель выигрывает у другой на обычных продуктовых задачах, но разваливается на HLE-подобных вопросах, это сигнал о хрупкости её длинного рассуждения, узкой специализации или плохой самооценке уверенности.
При этом рост результатов post-release нужно читать осторожно. Он может означать и реальные улучшения в reasoning, и лучшее использование test-time compute, и частичное влияние публичности самого бенчмарка. Поэтому HLE хорош как индикатор направления, но не как окончательный судья прогресса.
Ограничения и критика
1. Сложность здесь частично сконструирована. HLE специально отбирает задачи, которые уже валят текущие модели. Это делает тест полезным для frontier-оценки, но менее «естественным» как срез реальных пользовательских запросов. Именно поэтому низкий процент на HLE нельзя напрямую переводить в бытовое «модель знает лишь четверть материала».
2. Публичность создаёт риск контаминации. В Nature авторы отдельно отделяют post-release модели, потому что после open-source релиза разработчики уже могли видеть публичные вопросы. Официальный GitHub-репозиторий HLE даже содержит canary string и прямое предупреждение, что данные бенчмарка не должны попадать в training corpora.
3. У качества разметки были реальные проблемы. Официальный проект открыл bug bounty 11 февраля 2025 года, закрыл его 21 марта 2025 года, а 3 апреля 2025 года зафиксировал финальную версию из 2,500 вопросов после удаления или замены части проблемных задач. В статье Nature авторы оценивают disagreement rate экспертов на публичном наборе в 15.4%. Отдельная работа HLE-Verified от 15 февраля 2026 года идёт дальше: по её данным, систематическая верификация и ремонт задач повышают среднюю точность семи моделей на 7–10 процентных пунктов. Это сильный сигнал, что исходный HLE полезен, но не безошибочен как измерительный прибор.
4. HLE не равен «AGI-тесту». И официальный сайт, и статья Nature прямо говорят, что высокий результат на HLE не означает автономные исследовательские способности или общий интеллект. Это закрытый академический benchmark, а не тест на реальную долгую работу в среде.
5. Покрытие не идеально сбалансировано. В Nature авторы отмечают более сильную представленность математики и STEM-направлений. Кроме того, в доступных первичных материалах нет единого агрегированного human baseline для всей HLE, поэтому сравнение «модель против человека» остаётся скорее качественным, чем аккуратно измеренным числом.
Вывод
Humanity’s Last Exam — это важный и, по меркам публичных academic evals, довольно честный шаг вперёд: широкий, закрытый, сложный и калибровочно-чувствительный тест, который действительно дольше старых наборов сопротивлялся насыщению. Но его нужно читать как инструмент для frontier-диагностики, а не как окончательный рейтинг «кто умнее».
Если запомнить одну мысль, то вот она: HLE ценен не громким названием, а тем, что показывает пределы моделей там, где им приходится отвечать на узкие экспертные вопросы и при этом признавать или не признавать собственную неуверенность.
Источники
- Humanity’s Last Exam — исходная arXiv-версия HLE от 24 января 2025 года.
- A benchmark of expert-level academic questions to assess AI capabilities — peer-reviewed статья в Nature, опубликована 28 января 2026 года.
- Humanity’s Last Exam — официальный сайт проекта HLE с таймлайном релизов и текущими официальными результатами.
- Humanity’s Last Exam | Scale Labs — официальная исследовательская страница Scale Labs для исходного релиза HLE.
- Scale AI and CAIS Unveil Results of Humanity’s Last Exam, a Groundbreaking New Benchmark — официальный анонс результатов от Scale AI, 23 января 2025 года.
- GitHub – centerforaisafety/hle: Humanity’s Last Exam — код и практические детали запуска официальной оценки HLE.
- HLE-Verified: A Systematic Verification and Structured Revision of Humanity’s Last Exam — пострелизная работа по верификации и ремонту исходного HLE.
FAQ
HLE проверяет знания или рассуждение?
И то и другое, но только в формате закрытых задач. Вопросы специально стараются сделать трудными для простого retrieval, а модели дополнительно обязаны указывать уверенность в ответе.
Почему низкий процент на HLE не означает, что модель «ничего не знает»?
Потому что HLE отбирался именно как набор задач, которые уже ломали frontier-модели. Это не случайный экзамен из учебника, а специально сконструированный stress test.
Можно ли по HLE выбирать модель для продукта?
Только частично. HLE полезен как верхний слой сложности и тест на calibration, но его нужно дополнять своими evals на реальных задачах: tool use, RAG, код, latency, стоимость и отказоустойчивость.
Чем HLE-Verified отличается от исходного HLE?
HLE-Verified не придумывает новый тип задач, а систематически проверяет и при необходимости исправляет существующие вопросы и эталоны ответов. Это попытка сделать измерение на HLE более надёжным.
