7 ноября 2024 года Epoch AI выложила на arXiv технический отчет FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI, а 8 ноября опубликовала официальный анонс бенчмарка. FrontierMath задумывался как тест на продвинутое математическое рассуждение: задачи новые, ранее не публиковавшиеся, ответы проверяются автоматически, а для решения модели могут писать и запускать код. В этом разборе мы говорим именно о версии FrontierMath_10-22-24, которую анализировал отчет 2024 года; это важно, потому что 12 июня 2026 года Epoch выпустила v2 с крупными исправлениями, и исторический результат «ни одна модель не превышает 2%» нельзя переносить на текущий лидерборд без оговорок.
Коротко
- FrontierMath появился как ответ на две проблемы старых математических бенчмарков: насыщение и риск утечки тестовых задач в обучение.
- В отчете 2024 года на версии
FrontierMath_10-22-24с 119 задачами ни одна из шести моделей не превысила 2% средней точности; более 98% задач оставались нерешенными. - Главная методическая идея — сочетание новых экспертных задач, автоматической проверки и режима, где модель может пользоваться
Pythonи повторять попытки. - FrontierMath измеряет не «всю математику», а узкий, но полезный класс задач с автоматически проверяемым итоговым ответом. Полноценные доказательства и формальная верификация сюда почти не входят.
- Позднее сам Epoch уточнил ограничения набора: по состоянию на 12 июня 2026 года была выпущена v2, где исправления затронули 42% задач. Поэтому FrontierMath нужно цитировать только с датой и версией.
Контекст: зачем понадобился FrontierMath
К 2024 году у языковых моделей уже было достаточно сильное портфолио на школьной и олимпиадной математике. Но для практиков возникла более неприятная проблема: высокие баллы на старых наборах плохо отвечали на вопрос, умеет ли модель разбираться с длинными, свежими и предметно-специфичными задачами. Именно это и пытается чинить FrontierMath.
Авторы отчета прямо противопоставляют FrontierMath ранним наборам вроде MATH и GSM8K. Эти бенчмарки важны для истории области, но их задачи в основном относятся к более ранним ступеням сложности, а сами материалы давно присутствуют в публичном интернете. Для оценки фронтир-моделей это создает двойной риск: во-первых, данные оказываются слишком знакомыми, во-вторых, даже хороший результат может частично отражать запоминание, а не реальное рассуждение.
FrontierMath предлагает другой компромисс. Вместо большого публичного корпуса авторы собрали закрытый набор новых задач от математиков, а вместо ручной проверки эссе или доказательств выбрали формат автоматически проверяемого ответа. По данным технического отчета, в создании набора участвовали более 60 математиков из более чем дюжины стран; в том же отчете говорится, что задачи покрывают 70% верхнеуровневых рубрик классификации MSC2020. Эти числа важны не как маркетинг, а как объяснение замысла: бенчмарк должен был быть одновременно широким по тематике и достаточно свежим, чтобы уменьшить загрязнение теста обучающими данными.
Историческая оговорка здесь обязательна. Официальная страница FrontierMath позже уточнила, что paper 2024 года анализировал именно FrontierMath_10-22-24, то есть версию из 119 задач. Уже в 2025–2026 годах набор расширялся и исправлялся. Поэтому вопрос «умеют ли модели решать FrontierMath?» без указания версии просто некорректен.
Метод: как устроен FrontierMath
Как собирали задачи
Сильная сторона FrontierMath — не только высокая сложность, но и четкие правила отбора. Авторы требовали от задач четырех свойств: оригинальности, автоматической проверяемости, «неугадываемости» и вычислительной реализуемости. Под «неугадываемостью» они понимали практическое правило: вероятность угадать правильный ответ без основной математической работы не должна превышать 1%. Под вычислительной реализуемостью — то, что необходимые скрипты для решения или проверки не должны требовать экзотической инфраструктуры и должны укладываться примерно в минуту на обычном железе.
Ответ чаще всего должен быть числом или объектом, который можно представить через SymPy. Это делает проверку дешевой и воспроизводимой: не нужно собирать панель экспертов, чтобы оценивать каждую попытку модели. Но у такого решения есть цена: задачи на доказательство теорем в человеческом стиле почти выпадают из охвата.
Как проверяли ответы
Для каждой задачи модель в итоге должна вернуть Python-объект. Если ответ уникален и является целым числом, проверка тривиальна: точное совпадение. Если ответ — символьный объект, используется проверка через упрощение выражений в SymPy. Если задача допускает множество решений, применяется отдельный скрипт-верификатор. Это делает FrontierMath ближе не к экзамену с ручной проверкой, а к инженерной системе оценивания.
В paper подчеркивается еще один важный момент: авторы сознательно не требовали формальных доказательств на языках вроде Lean или Coq. Их аргумент прагматичен. Во-первых, они хотели мерить математическое рассуждение, а не навык писать в формальном доказательном языке. Во-вторых, покрытие современной математики в таких экосистемах все еще ограничено.
Как запускали модели
В отчете 2024 года FrontierMath тестировался не в режиме «один запрос — один ответ». Модель получала задачу, могла писать блоки кода, видеть результат выполнения, уточнять гипотезы и только потом отправлять финальный ответ. Иными словами, это уже не чистый бенчмарк на текстовую генерацию, а ранняя форма оценки с test-time compute.
- Модель получает новую задачу FrontierMath.
- Пробует решить ее рассуждением и/или через код в среде
Python. - Видит результаты вычислений и ошибки выполнения.
- Повторяет цикл несколько раз, если считает нужным.
- Отправляет финальный ответ в стандартизированном формате.
По самому paper, лимит в этих экспериментах составлял 10 000 токенов на задачу. Тестировались шесть моделей: o1-preview, o1-mini, GPT-4o версии 2024-08-06, Claude 3.5 Sonnet версии 2024-10-22, Grok 2 Beta и Gemini 1.5 Pro 002. Это еще одна причина, почему результаты нельзя бездумно переносить на более поздние поколения моделей.
Результаты: что показал бенчмарк в версии 2024 года
Главный вывод совпадает в двух первичных документах — в arXiv-отчете от 7 ноября 2024 года и в официальном посте Epoch AI от 8 ноября 2024 года: на версии, которую анализировали авторы, ни одна модель не превысила 2% средней точности, а более 98% задач оставались нерешенными. Ниже — ключевые числа. Часть из них известна только из самого технического отчета и не имеет отдельной внешней репликации; в таких случаях мы явно пересказываем именно данные paper.
| Параметр | Что зафиксировано | Почему это важно |
|---|---|---|
| Версия набора в paper | FrontierMath_10-22-24, 119 задач |
Это исторический срез, а не нынешний FrontierMath. |
| Главный результат | Ни одна из шести моделей не превысила 2% средней точности; более 98% задач оставались нерешенными | Показывает, что фронтир-модели конца 2024 года были очень далеки от устойчивого решения задач такого класса. |
| Стабильность успехов | Хотя бы раз кем-либо были решены только 4 задачи; лишь в одном случае одна модель решила задачу во всех 5 повторных прогонах | Разовый правильный ответ еще не означает сформированный навык. |
| Поведение при итерациях | По paper, o1-preview в среднем делал 1.29 ответа на задачу, а Grok 2 Beta — 3.81 |
Больше шагов и больше «размышления вслух» сами по себе не давали заметного преимущества. |
| Использование токенов | По paper, Gemini 1.5 Pro 002 упирался в лимит 10 000 токенов в 16.8% задач; Claude 3.5 Sonnet, GPT-4o и Grok 2 Beta — более чем в 45% попыток |
Дополнительный вычислительный бюджет помогает не автоматически и не одинаково для разных моделей. |
| Pass@8 | В приложении к paper лучший результат показал o1-preview — около 6%; у Grok 2 Beta было около 2% |
Несколько попыток улучшают результат, но не меняют общую картину радикально. |
Еще одна важная деталь: сами авторы призывают осторожно интерпретировать ранжирование моделей. На полном наборе был только один прогон, а при таком низком числе успехов даже одна-две удачные задачи могут заметно переставить порядок мест. Иначе говоря, FrontierMath 2024 года лучше читать не как точный рейтинг, а как индикатор очень большого разрыва между «сильной математикой в бенчмарках» и «длинным продвинутым решением свежих задач».
Интерпретация
Если убрать шум вокруг таблицы лидеров, FrontierMath показал довольно простую вещь: высокие результаты на школьной, университетской и даже олимпиадной математике еще не означают готовность к задачам, где нужны длинная цепочка идей, предметная интуиция и аккуратная проверка гипотез. И это особенно важно для практиков, которые пытаются понять пределы «рассуждающих» моделей в исследовательских или инженерных сценариях.
FrontierMath также сдвинул сам формат оценки. Здесь важно не только получить число в конце, но и решить, когда стоит считать руками, когда писать код, когда остановиться, а когда перепроверить гипотезу. Такой режим ближе к реальной работе исследователя, чем большинство старых математических тестов.
Наш комментарий
На наш взгляд, FrontierMath важен не столько как очередной «самый сложный бенчмарк», сколько как переход к другому протоколу оценки. Он объединяет три вещи, которые редко встречались вместе: свежие закрытые задачи, инструментальную среду выполнения кода и автоматическую верификацию результата. Именно эта комбинация позже стала типичной для более серьезных eval-пайплайнов.
Но есть и более трезвый вывод. FrontierMath 2024 года не доказывал, что модели «не умеют в математику вообще». Он показывал более узкое утверждение: в конце 2024 года даже сильные модели, получив Python и дополнительное время на ответ, все еще почти не справлялись с конкретным классом новых, длинных и автоматически проверяемых задач продвинутой математики.
Ограничения и критика
- Это версионный, а не вечный факт. Paper анализировал
FrontierMath_10-22-24из 119 задач. Уже 12 июня 2026 года Epoch выпустил v2, указав, что исправления затронули 42% задач, а полный набор теперь состоит из 338 задач. Поэтому фразу «на FrontierMath модели набирают меньше 2%» можно употреблять только как описание исторического состояния на ноябрь 2024 года. - Бенчмарк измеряет не всю математическую компетентность. Из-за требования автоматической проверки он в основном работает с числовыми и символьными ответами. Это сильная инженерная идея, но она плохо покрывает человеческие доказательства, формальную строгость и объяснительную ценность решения.
- Авторы сами фиксировали ошибки в наборе. В technical report говорится, что при дополнительной проверке 2 из 35 задач содержали неверный ответ, 6 из 35 имели недостающие предположения, а еще для 2 из 35 были найдены способы угадать ответ легче, чем следовало бы. Авторы оценили разумный уровень критических ошибок примерно в 10%. Поздняя публикация v2 делает эту оговорку еще важнее.
- Сложность задач оценивалась людьми и была шумной. Paper прямо пишет, что оценки сложности у авторов и ревьюеров нередко расходились. То есть FrontierMath хорошо различает «очень трудно» и «не очень трудно», но хуже подходит для тонкой калибровки между соседними уровнями сложности.
- Есть вопрос о доступе к данным и конфликте интересов. В январе 2025 года Epoch отдельно уточнил, что OpenAI профинансировала создание 300 задач, владеет ими и имела доступ к утверждениям и решениям, кроме holdout-набора. Это не обнуляет ценность бенчмарка, но влияет на интерпретацию межлабораторных сравнений и на дискуссию о contamination.
- Даже правильный ответ не гарантирует правильное рассуждение. Авторы отмечают, что по крайней мере в одном случае верный ответ можно было получить с помощью простых симуляций и удачного угадывания. Значит, FrontierMath лучше измеряет итоговую решаемость задач этого класса, чем «чистую» математическую глубину внутреннего рассуждения модели.
Вывод
FrontierMath в версии ноября 2024 года был важным сигналом: между сильными результатами на привычных математических бенчмарках и устойчивым решением свежих задач продвинутой математики оставался большой разрыв. Но еще важнее другое: FrontierMath показал, что новые eval’ы придется описывать не одной цифрой, а связкой из версии, протокола, доступа к инструментам и качества самих задач. Если помнить об этой рамке, FrontierMath полезен не как миф о «невозможной математике», а как честный урок о том, как трудно вообще измерять границы reasoning-моделей.
Источники
- FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI — основной технический отчет от 7 ноября 2024 года.
- FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI — официальный анонс Epoch AI от 8 ноября 2024 года.
- About FrontierMath — страница с версионированием набора и уточнением, что paper анализировал
FrontierMath_10-22-24. - Clarifying the creation and use of the FrontierMath benchmark — официальный пост Epoch AI о финансировании, владении задачами и доступе к данным.
- FrontierMath Tier 4 (v2) — актуальная страница Epoch AI с changelog от 12 июня 2026 года и данными об исправлениях в v2.
- Measuring Mathematical Problem Solving With the MATH Dataset — ранний математический бенчмарк, важный для контекста.
- Training Verifiers to Solve Math Word Problems — paper, представивший GSM8K, тоже важный для контекста.
FAQ
FrontierMath — это тест на математические доказательства?
Не совсем. FrontierMath ближе к тесту на решение сложных задач с автоматически проверяемым финальным ответом. Он может требовать глубоких идей, но не проверяет полноценное человеческое доказательство так, как это делал бы формальный или экспертно-оцениваемый экзамен.
Почему результат «меньше 2%» нельзя повторять без даты?
Потому что он относится к версии FrontierMath_10-22-24, описанной в отчете 2024 года. После этого набор расширялся и исправлялся; 12 июня 2026 года Epoch выпустил v2 и прямо сообщил о существенных корректировках.
Можно ли напрямую сравнивать FrontierMath с MATH, GSM8K или AIME?
Только очень осторожно. У FrontierMath другой формат, другой риск contamination, другая степень новизны задач и другой протокол оценки с кодом и итерациями.
Означает ли FrontierMath, что модели бесполезны для математики?
Нет. Он показывает границу конкретного режима: свежие, длинные и автоматически проверяемые задачи продвинутой математики в версии 2024 года оставались трудными даже для сильных моделей. Это не то же самое, что общий вывод о всей математике.
