GPQA — benchmark David Rein и соавторов, который, по карточке arXiv, появился как препринт 20 ноября 2023 года, а в репозитории авторов затем цитируется как conference paper на First Conference on Language Modeling (COLM) 2024. В исходной постановке это 448 multiple-choice вопросов по биологии, физике и химии, написанных людьми с PhD-экспертизой и специально отобранных так, чтобы их было трудно решить даже сильному неэксперту с доступом к вебу.
Важность GPQA не в том, что он якобы «универсально меряет интеллект модели». Его задача уже и практичнее: дать testbed для scalable oversight, где истина известна экспертам, но плохо проверяется обычным наблюдателем. Ниже — разбор именно работы Rein et al. в её исходной версии 2023–2024 годов, без подмены более поздними leaderboard-цифрами.
Коротко
- GPQA задуман как benchmark для задач, где модель может знать больше проверяющего, а простой веб-поиск не даёт надёжной верификации.
- В основной версии GPQA — 448 вопросов; авторы также описывают более широкий набор GPQA Extended на 546 вопросов и более строгий поднабор GPQA Diamond на 198 вопросов.
- По статье и официальной карточке датасета, эксперты в релевантных областях достигают 65% accuracy, skilled non-experts с доступом к вебу — 34%, а сильнейший GPT-4 baseline на релизе — 39%.
- «Google-proof» здесь не означает «ответ невозможно найти в интернете». Это означает, что даже подготовленный человек вне своей области, имея время и веб-доступ, всё равно часто не может собрать и проверить ответ.
- Главные ограничения GPQA: узкий научный домен, multiple-choice формат, selection effects на subset-оценках людей и неизбежное старение любого публичного benchmark.
Контекст
Большая часть популярных QA-benchmark’ов измеряет либо знакомство модели с публичными экзаменационными данными, либо способность воспроизводить ответы, которые легко проверяются поиском. Для продуктовой оценки это полезно, но для задач научного ассистирования и AI safety — не всегда. Если модель отвечает на вопрос, который человек без узкой подготовки не умеет быстро верифицировать, возникает разрыв между answering и oversight.
Именно в этот разрыв и целится GPQA. Авторы опираются на линию работ о scalable supervision/oversight: как проверять более сильную систему, если судья слабее по знаниям или времени. В классической формулировке проблемы это обсуждалось ещё в Concrete Problems in AI Safety, а затем — в протоколах вроде AI safety via debate. GPQA нужен не как очередной «экзамен для LLM», а как лабораторный стенд для таких режимов проверки.
Важно и то, чем GPQA не является. Это не benchmark общего знания, не симулятор настоящего научного исследования и не окончательный тест «рассуждения». Это узко поставленная среда: есть правильный ответ, он известен экспертам, distractor-опции сделаны правдоподобными, а неэксперт с вебом всё равно часто ошибается.
Метод
Сильная сторона работы — не только сами вопросы, но и способ их сбора. Авторы набирали исполнителей через Upwork и требовали, чтобы «эксперты» уже имели PhD или учились в PhD-программе по своей области. Вопросы покрывают три крупные области: biology, physics и chemistry.
- Написание вопроса. Эксперт формулирует сложный вопрос внутри своей специализации, добавляет четыре варианта ответа и объяснение: почему один вариант верный и почему остальные выглядят правдоподобно.
- Первая экспертная проверка. Другой эксперт в той же области пытается ответить и оставляет подробный фидбек по корректности, ясности и сложности.
- Ревизия. Автор вопроса дорабатывает формулировку после первой проверки.
- Вторая экспертная проверка. Ещё один эксперт решает уже исправленную версию. Это нужно не только для accuracy, но и для оценки того, насколько вопрос объективен и имеет неоспоримо правильный ответ.
- Проверка неэкспертами. Три сильных валидатора из других научных областей решают тот же вопрос с неограниченным доступом к интернету, но без LLM-ассистентов. По статье, минимум был 15 минут на вопрос, а среднее время составило 37 минут при медиане 30 минут.
Отсюда и появляется термин Google-proof. Он не про магический запрет на поиск, а про эмпирический факт: неэкспертам разрешили пользоваться вебом, но это всё равно не превратило задачу в тривиальную retrieval-задачу.
Авторы публикуют несколько сплитов. По таблице 2 статьи, GPQA Extended содержит 546 вопросов. GPQA как основной набор — 448 вопросов; в него не включают случаи, где вопрос, по сути, провалил критерии «объективен и труден». GPQA Diamond — самый строгий поднабор на 198 вопросов, где отбор по экспертному согласию и неуспеху неэкспертов ещё жёстче.
Отдельная важная деталь — защита от leakage. В статье есть просьба не публиковать примеры вопросов в открытом виде, в репозитории присутствует canary string, а официальный датасет на Hugging Face gated. Это не делает contamination невозможным, но показывает, что авторы осознавали проблему ещё на релизе.
Результаты
Ниже — ключевые числа по исходной статье Rein et al.; таблица сведена по таблицам 2 и 5 и дополнительно совпадает со вторичным разбором AICAT News. Для оценок людей на main и diamond авторы сами ставят пометку о selection effects.
| Сплит | Как отбирался | Вопросов | Эксперты, % | Неэксперты, % | GPT-4 few-shot CoT, % | GPT-4 with search, % |
|---|---|---|---|---|---|---|
| GPQA Extended | Полный релизный набор | 546 | 64.8 | 34.1 | 38.7 | 39.4 |
| GPQA (main) | Минимум частичное согласие экспертов и ограниченный успех неэкспертов | 448 | 71.9* | 30.4* | 39.7 | 41.0 |
| GPQA Diamond | Самый строгий фильтр по экспертному согласию и неуспеху неэкспертов | 198 | 81.3* | 22.1* | 38.8 | 38.8 |
*Авторская пометка: оценки людей на main и diamond смещены из-за самого способа отбора вопросов в эти поднаборы.
Самая заметная цифра в релизе — разрыв между экспертами и всеми остальными. По статье и официальной карточке датасета, эксперты в релевантной области достигают 65% accuracy, а skilled non-experts с веб-доступом — только 34%. Сильнейший baseline авторов, GPT-4, выходит примерно на 39%: то есть чуть выше неэксперта, но заметно ниже эксперта.
Это делает GPQA особенно интересным именно для протоколов supervision. Если модель была бы слабее неэксперта, benchmark мало что говорил бы о будущем oversight. Если бы модель уже уверенно превосходила эксперта, задача была бы другой. На релизе GPQA попал в промежуточную зону: модель уже не тривиальна, но доверять ей вслепую нельзя.
Отдельно показателен open-book режим. По таблице 5, search-версия GPT-4 почти не улучшает результат на Extended относительно few-shot CoT: 39.4% против 38.7%. При этом в статье авторы отдельно пишут, что search-сетап часто воздерживался от ответа, и им пришлось делать backoff к обычному few-shot CoT-ответу. Это важная деталь: слабый прирост от поиска здесь нельзя читать как доказательство, что retrieval бесполезен вообще; это скорее результат конкретного инструментария и prompting-схемы в статье.
По таблице 3 статьи, GPQA неоднороден и по доменам. На Extended biology даёт 105 вопросов, physics — 227, chemistry — 214. Самый большой expert–non-expert gap авторы фиксируют в chemistry: 40.6 процентного пункта против 23.5 в biology и 24.8 в physics. То есть benchmark не просто «сложный в среднем», а по-разному нагружает разные типы научной подготовки.
Интерпретация
Наш комментарий
GPQA полезен тем, что бьёт не по одному навыку, а по связке навыков. Чтобы хорошо отвечать на такие вопросы, системе мало помнить учебниковый факт. Нужно распознать, какой именно кусок доменного знания релевантен, не попасться на правдоподобные distractor-опции, а в open-book режиме ещё и правильно использовать внешние источники.
Для практиков это означает следующее: GPQA стоит читать не как «чистый benchmark рассуждения», а как смесь из доменного знания, научной грамотности, careful reasoning и tool use. В этом смысле он ближе к реальной работе научного ассистента, чем многие академические exam-benchmark’и, но всё ещё остаётся контролируемой задачей с фиксированным множественным выбором.
Ещё один важный вывод: GPQA измеряет не только способность модели ответить, но и сложность человеческой проверки. Это редкий случай, когда benchmark встроенно моделирует проблему надзора: у судьи есть интернет, время и высокий общий уровень подготовки, но этого всё равно недостаточно для надёжной верификации.
Ограничения
1. Узкий охват доменов. GPQA ограничен biology, physics и chemistry. Это плюс для контроля качества, но минус для обобщения: нельзя автоматически переносить выводы на право, медицину, программирование или междисциплинарные инженерные задачи.
2. Multiple-choice формат упрощает реальную науку. Авторы старались писать вопросы так, чтобы на них можно было отвечать и без вариантов, но в статье основная оценка всё равно multiple-choice. Это значит, что benchmark проверяет выбор среди правдоподобных альтернатив, а не построение ответа с нуля.
3. Объективность оценена не идеально. В статье авторы консервативно оценивают долю вопросов с неоспоримо правильным ответом на уровне 74% для Extended, причём это именно оценка для полного набора, а не прямое измерение для всех поднаборов. Для main и diamond авторы ожидают более высокую объективность, но это уже вывод по логике фильтрации, а не отдельное число, независимо измеренное на тех же условиях.
4. Human scores на main и diamond нельзя читать буквально. Поскольку эти сплиты уже отфильтрованы по экспертному согласию и неуспеху неэкспертов, рост expert accuracy и падение non-expert accuracy там частично заложены самой процедурой отбора. Авторы это прямо оговаривают.
5. Open-book baseline зависит от реализации. Небольшой выигрыш GPT-4 с поиском в этой работе не доказывает общий предел tool-augmented reasoning. Он показывает только то, что конкретный search-пайплайн Rein et al. не превращал GPQA в простую задачу. Другой агентный контур, другие запросы к поиску и другой механизм чтения источников могут дать иную картину.
6. Любой публичный benchmark стареет. GPQA вышел уже с защитой от leakage — gated release, canary string, просьба не публиковать вопросы открыто, — но ни одна такая мера не вечна. Если benchmark долго живёт в экосистеме, на него начинают влиять contamination, fine-tuning и оптимизация под leaderboard.
Вывод
GPQA важен не потому, что «самый умный» или «самый сложный» benchmark вообще, а потому что он аккуратно формализует редкую и полезную постановку: вопрос знает эксперт, модель может быть полезнее неэксперта, а веб-поиск не снимает проблему проверки. Для исследований human-AI oversight это намного ближе к реальной боли, чем обычные экзаменационные наборы.
Если вам нужен короткий итог, он такой: GPQA — это benchmark не про голую память и не про чистую математику, а про пределы научной верификации под ограничениями человека. Именно поэтому его стоит читать вместе с методологией сбора, а не только с leaderboard-цифрами.
Источники
- David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, Samuel R. Bowman. GPQA: A Graduate-Level Google-Proof Q&A Benchmark — основной первоисточник: постановка задачи, pipeline, split’ы, baseline-результаты.
- David Rein et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark — First Conference on Language Modeling (COLM) 2024 — конференционная публикация, на которую ссылаются сами авторы.
- idavidrein/gpqa — официальный репозиторий: код, baseline-файлы, release-практики и canary string.
- Idavidrein/gpqa — Dataset Card — официальная карточка датасета: описание, intended use и gated release-условия.
- GPQA: A Graduate-Level Google-Proof Q&A | AICAT News — вторичный разбор, полезный как независимая сверка таблиц 2, 3 и 5.
- Dario Amodei et al. Concrete Problems in AI Safety — контекст для scalable supervision/oversight.
- Geoffrey Irving, Paul Christiano, Dario Amodei. AI safety via debate — пример oversight-протокола, под который GPQA хорошо подходит как testbed.
FAQ
Почему GPQA называют «вопросами, которые не гуглятся»?
Потому что авторы проверяли не только модель, но и сильных неэкспертов с доступом к интернету. Если даже такой валидатор часто не может надёжно собрать ответ, задача выходит за рамки простого веб-поиска.
Чем GPQA отличается от обычного exam-benchmark?
Не только сложностью. Ключевое отличие — процедура валидации: вопрос должен быть одновременно объективным для эксперта и трудным для неэксперта с веб-доступом. Это делает benchmark полезным для supervision-сценариев, а не только для «оценки знаний».
Что такое GPQA Diamond?
Это самый строгий поднабор GPQA. В него попадают только вопросы, где экспертное согласие высокое, а неэксперты в большинстве случаев ошибаются. Поэтому Diamond удобен как «чистый» subset, но его human scores смещены самим способом отбора.
Можно ли считать GPQA тестом рассуждения?
Частично да, но не в изоляции. Он проверяет смесь доменного знания, научной грамотности, careful reasoning и работы с источниками. Сводить его только к reasoning benchmark было бы слишком грубо.
