В мае 2024 года Scale AI опубликовала работу A Careful Examination of Large Language Model Performance on Grade School Arithmetic, а 22 ноября 2024 года на arXiv появилась её camera-ready версия для NeurIPS 2024. Авторы предложили GSM1k — закрытый набор задач, стилистически похожий на GSM8k, чтобы проверить, не завышают ли публичные математические бенчмарки реальную способность моделей к рассуждению. Для практиков это важный кейс: высокий балл на известном тесте может отражать не только навык, но и качество «гигиены» обучения и оценки.
Коротко
- GSM1k задуман как retro-holdout для GSM8k: новый набор задач с похожей сложностью, но без гарантированного попадания в обучающие данные моделей.
- В финальной версии работы авторы сообщают о падении точности до 8 процентных пунктов на GSM1k относительно GSM8k; ранняя страница Scale Labs от 1 мая 2024 года всё ещё пересказывает более раннюю цифру — до 13 п.п. Эти значения нельзя смешивать без указания версии источника.
- По аудиту самих авторов, люди почти не отличали GSM1k от GSM8k по форме, а timed solve-rate у двух наборов оказался сопоставимым. Это делает аргумент «новый тест просто был сложнее» менее убедительным.
- Авторы нашли положительную связь между разрывом GSM8k→GSM1k и вероятностью модели воспроизвести примеры GSM8k. Но сама работа прямо пишет, что утечка данных — не единственное объяснение переобучения.
- Главческий практический вывод: публичный benchmark score нужно читать вместе с историей данных, протоколом оценки и наличием приватного holdout-набора.
Контекст
GSM8k появился в ноябре 2021 года как набор из 8.5K школьных текстовых задач по математике и быстро стал стандартным тестом для оценки многошагового рассуждения в LLM. Это подтверждают и исходная статья Карла Коббе с соавторами, и официальный пост OpenAI о релизе набора. Проблема в том, что любой популярный публичный бенчмарк со временем начинает жить двойной жизнью: он остаётся тестом, но одновременно превращается в скрытую часть тренировочного распределения.
К 2023–2024 годам тема утечек перестала быть чисто теоретической. В позиции Sainz и соавторов для EMNLP 2023 прямо сказано, что классическая benchmark-оценка в NLP «в trouble», если модель обучалась на тестовом сплите или на очень близких к нему данных. В работе Deng и соавторов на NAACL 2024 показано, что contamination можно искать и косвенными методами даже без доступа к полным обучающим корпусам закрытых моделей. На этом фоне идея Scale AI выглядела не как очередной лидерборд, а как попытка проверить сам GSM8k на «инфляцию метрики».
Важно и ещё одно уточнение. Тема статьи пользователя звучит как «GSM1k и проблема утечек», но в реальности работа Scale AI в первую очередь говорит не о том, что GSM1k измеряет «чистую математику» лучше всех, а о том, что он помогает аудировать уже существующий GSM8k. Это разный класс задач: не новый SOTA-бенчмарк, а контрольный приватный срез для проверки загрязнения.
Метод
Исторический срез и версия источника
Здесь критично фиксировать даты. Страница Scale Labs с датой 1 мая 2024 года пересказывает раннюю версию исследования и пишет о падении точности до 13 п.п. и о корреляции 0.32. Но финальная camera-ready версия статьи, загруженная на arXiv 22 ноября 2024 года и опубликованная в треке Datasets and Benchmarks на NeurIPS 2024, уже сообщает другие числа: падение до 8 п.п. и Spearman-корреляцию 0.36. Публичного changelog с объяснением расхождения в доступных источниках нет, поэтому безопаснее считать финальную paper-версию базовой, а раннюю web-страницу — историческим следом более раннего состояния работы.
Как собрали GSM1k
По статье Zhang и соавторов, GSM1k создавали только люди, без помощи LLM. Аннотаторам показывали по три примера из GSM8k и просили написать новые задачи сопоставимой сложности. Затем набор проходил серию фильтров: проверку решений, независимое повторное решение, калибровку сложности и выравнивание распределения величин ответов.
Здесь есть важная деталь, которую легко пропустить. В финальной paper-версии прямо написано, что итоговый GSM1k содержит 1205 задач. Однако на публичной leaderboard-странице Scale Labs говорится о 1000 вопросах и о том, что наружу выпущены только 50 примеров. Доступные источники не объясняют это расхождение явно; на наш взгляд, речь, скорее всего, идёт о различии между исследовательской финальной выборкой и публичной упаковкой датасета, но это именно вывод по косвенным признакам, а не установленный факт.
Чтобы показать сопоставимость GSM1k и GSM8k, авторы провели два контрольных теста. Во-первых, по данным самой статьи, 19 аннотаторов в задаче «найди лишний вопрос» распознавали пример из GSM1k в 21.83% случаев при случайном ожидании 20%. Во-вторых, по тому же источнику, 14 других аннотаторов за 15 минут в среднем решали 4.07±0.93 задач из GSM8k и 4.36±1.11 задач из GSM1k. Иными словами, заметного человеческого сигнала о том, что GSM1k «совсем другой» или существенно сложнее, авторы не нашли.
Как оценивали модели
Финальная статья использует форк LM Evaluation Harness. Для обоих наборов применялся одинаковый 5-shot prompt с примерами из тренировочной части GSM8k; максимальную длину генерации увеличили с 256 до 1000 токенов, чтобы не обрезать chain-of-thought у длинных ответов. Открытые модели запускались при temperature 0, а закрытые модели опрашивались через LiteLLM. По данным статьи, API-запросы к проприетарным моделям делались в период с 16 апреля по 5 июня 2024 года, то есть это строго исторический срез моделей того времени, а не «текущая» оценка по состоянию на 2026 год.
Это замечание важно ещё и потому, что поздняя leaderboard-страница Scale использует уже другой протокол. Там финальный ответ дополнительно отбирается человеком, из-за чего итоговые accuracies выше, чем в paper-оценке. Следовательно, paper-числа и leaderboard-числа нельзя сравнивать напрямую как будто это один и тот же эксперимент.
Результаты
| Наблюдение | Что говорят источники | Почему это важно |
|---|---|---|
| Базовый бенчмарк GSM8k | Исходные источники OpenAI и статья Cobbe et al. описывают GSM8k как набор из 8.5K школьных задач, выпущенный в 2021 году. | Это подтверждает, что речь идёт о давно публичном и широко используемом тесте, а значит риск утечек не выглядит экзотикой. |
| Размер и публичность GSM1k | Финальная paper-версия говорит о 1205 задачах; публичная страница Scale Labs — о 1000 вопросах и 50 выпущенных примерах. | Даже название GSM1k не полностью снимает вопрос о точном составе оценочного набора; для репликации это неудобно. |
| Сопоставимость с GSM8k | По данным авторов, в задаче на различение люди находили GSM1k лишь чуть выше случайного уровня, а timed solve-rate у GSM1k даже немного выше. | Это делает менее вероятным объяснение вида «модели просели только потому, что новый набор заметно сложнее». |
| Максимальный разрыв по точности | Финальная версия статьи и обзорный пост Scale AI говорят о падении до 8 п.п.; ранняя страница Scale Labs от 1 мая 2024 года сохраняет более раннюю формулировку — до 13 п.п. | Главный урок здесь не только в самом разрыве, но и в необходимости всегда фиксировать версию paper и дату веб-страницы. |
| Связь с вероятностью воспроизведения GSM8k | По данным финальной paper-версии, Spearman-корреляция между разрывом GSM8k→GSM1k и лог-правдоподобием генерации GSM8k равна 0.36 при p=0.03. | Это косвенно поддерживает гипотезу о частичной меморизации тестового набора. |
| Не все модели «ломаются» одинаково | Финальная статья и ранний summary Scale Labs сходятся в качественном выводе: Phi и Mistral выглядят систематически более переобученными, тогда как GPT, Claude и Gemini ближе к линии «без overfit». | Проблема касается не всех семейств одинаково; одного числа по GSM8k недостаточно для сравнения моделей. |
Главный фактический вывод финальной версии работы таков: часть моделей действительно заметно теряет качество на новом, сопоставимом по формату наборе задач. Авторы отдельно пишут, что семьи Phi и Mistral демонстрируют систематическую тенденцию показывать лучшие результаты на GSM8k, чем на GSM1k, почти на всех размерах и релизах; Yi, Xwin, Gemma и CodeLlama, по их оценке, проявляют тот же паттерн слабее. При этом многие frontier-модели, особенно в семействах GPT, Claude и Gemini, по описанию авторов почти не показывают признаков переобучения на этом тесте.
Ещё один полезный для практики вывод: overfit не равен отсутствию рассуждения. Авторы специально оговаривают, что даже модели с заметным провалом на GSM1k всё равно могут решать значительную долю новых задач. То есть загрязнение бенчмарка не превращает высокий результат на GSM8k в «полную фикцию»; оно делает этот результат смесью реальной способности и артефактов оценочного контура.
Почему в источниках встречаются и 13%, и 8%
Это не мелкая редакторская деталь, а хороший пример того, как ломается аккуратное чтение AI-источников. Ранняя страница Scale Labs, датированная 1 мая 2024 года, утверждает, что некоторые модели теряют до 13 п.п. на GSM1k и приводит корреляцию 0.32. Финальная arXiv/NeurIPS-версия от 22 ноября 2024 года сообщает уже 8 п.п. и 0.36. Поскольку объяснения пересчёта в открытых источниках нет, в техническом тексте корректно писать так: в раннем summary Scale Labs фигурировали 13 п.п., а в финальной paper-версии — 8 п.п. Если нужно цитировать саму работу как научный источник, опираться следует на финальную версию.
Интерпретация
Наш комментарий
Первое. GSM1k полезен не потому, что «наконец-то измерил настоящую математику», а потому, что показывает: публичный benchmark score — это составной сигнал. В нём смешаны реальное умение решать задачи, вероятность виденного примера или очень близкого паттерна в обучении, особенности постобучения и даже требования к формату ответа.
Второе. Стабильность frontier-моделей на GSM1k не доказывает автоматически, что у них не было contamination. Сама статья предлагает как минимум две возможные трактовки: либо эти модели действительно лучше обобщают школьную математику, либо разработчики аккуратнее выстроили decontamination и evaluation hygiene. Для закрытых моделей эти две гипотезы без доступа к данным обучения неразделимы.
Третье. Для индустриальной практики работа Scale AI — аргумент в пользу собственных приватных holdout-наборов. Если вы оцениваете модель для продакшена, особенно на задачах рассуждения, вам нужен не только общеизвестный тест вроде GSM8k, но и внутренний, нераскрытый и версионируемый набор кейсов. Иначе вы постепенно начинаете мерить не способность модели, а её близость к интернет-канону benchmark’а.
Четвёртое. Эта работа хорошо показывает, почему leaderboards без полного описания протокола легко вводят в заблуждение. Уже внутри одного проекта Scale paper-оценка и leaderboard-оценка оказываются несопоставимыми напрямую: в leaderboard добавлена ручная интерпретация финального ответа, и абсолютные значения accuracy становятся выше.
Ограничения
- Независимая проверка ограничена. Полный GSM1k не опубликован, поэтому сообществу сложнее воспроизвести оценку и проверить скрытые артефакты набора.
- Сигнал contamination косвенный. Работа не показывает обучающие корпуса закрытых моделей и не доказывает прямое присутствие конкретных примеров GSM8k в каждой модели. Она строит вероятностные аргументы по разрыву качества и log-likelihood.
- Протокол всё равно опирается на GSM8k. В основном эксперименте оба теста запускались с 5-shot примерами из train-части GSM8k. Авторы сообщают, что общая тенденция сохраняется и в абляциях, но сам факт такой привязки остаётся caveat.
- Есть путаница с размером набора. 1205 задач в финальной paper-версии и 1000 вопросов на публичной странице — неудобное расхождение, которое доступные источники явно не разводят.
- Область узкая. GSM1k проверяет школьную арифметику в текстовых задачах. Переносить выводы один в один на код, науку, long-context или агентные сценарии нельзя.
- Результаты исторические. Закрытые модели в статье опрашивались с 16 апреля по 5 июня 2024 года. Более поздние версии моделей и последующие leaderboard’ы — уже другой объект сравнения.
Вывод
Работа Scale AI про GSM1k важна не как «новый лучший тест по математике», а как аккуратный аудит старого популярного теста. Она даёт достаточно сильное эмпирическое основание считать, что у GSM8k есть проблема benchmark contamination, и что эта проблема способна заметно сдвигать perceived performance отдельных семейств моделей.
Но не менее важен второй вывод: утечки объясняют не всё. Даже заметно переобученные модели по-прежнему решают много новых задач, а слабый разрыв у frontier-моделей можно трактовать по-разному. Поэтому самый полезный урок для практиков звучит приземлённо: версионируйте оценки, держите приватные holdout-наборы и никогда не читайте один benchmark score вне контекста его происхождения.
Источники
- Hugh Zhang et al. (2024). A Careful Examination of Large Language Model Performance on Grade School Arithmetic.
- Hugh Zhang et al. (2024). A Careful Examination of Large Language Model Performance on Grade School Arithmetic — NeurIPS 2024 Datasets and Benchmarks Track PDF.
- Scale Labs (1 мая 2024). LLM Performance on Grade School Arithmetic.
- Scale Labs. Scale Labs Leaderboard: Math Evaluation.
- Karl Cobbe et al. (2021). Training Verifiers to Solve Math Word Problems.
- OpenAI (2021). Solving math word problems.
- Oscar Sainz et al. (2023). NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark.
- Chunyuan Deng et al. (2024). Investigating Data Contamination in Modern Benchmarks for Large Language Models.
FAQ
Что такое загрязнение бенчмарка в случае LLM?
Это ситуация, когда тестовые примеры или очень близкие к ним данные попадают в обучающее распределение модели. Тогда итоговый score частично измеряет память или близость данных, а не чистую способность обобщать.
GSM1k заменяет GSM8k?
Нет. По смыслу работы GSM1k нужен прежде всего как контрольный приватный holdout для аудита GSM8k, а не как универсальная замена всех математических тестов.
Доказывает ли статья, что модели просто запомнили ответы?
Нет. Она показывает косвенные признаки частичной меморизации и переобучения, но сама же подчёркивает: contamination не является полным объяснением наблюдаемого разрыва.
Почему нельзя просто взять leaderboard и сравнить числа?
Потому что даже внутри проекта Scale paper-оценка и leaderboard-оценка используют разные правила подсчёта. На leaderboard финальный ответ дополнительно интерпретируется человеком, поэтому абсолютные accuracies там выше.
