Запись архива

GPQA: как устроен benchmark с вопросами, которые не гуглятся

Разбор GPQA — benchmark Rein et al. для graduate-level science QA, где вопросы проверяют пределы веб-поиска, экспертной верификации и supervision моделей, а не только память.

Схема пайплайна GPQA: автор вопроса, первая экспертная проверка, ревизия, вторая экспертная проверка и валидация тремя неэкспертами с веб-поиском

GPQA — benchmark David Rein и соавторов, который, по карточке arXiv, появился как препринт 20 ноября 2023 года, а в репозитории авторов затем цитируется как conference paper на First Conference on Language Modeling (COLM) 2024. В исходной постановке это 448 multiple-choice вопросов по биологии, физике и химии, написанных людьми с PhD-экспертизой и специально отобранных так, чтобы их было трудно решить даже сильному неэксперту с доступом к вебу.

Важность GPQA не в том, что он якобы «универсально меряет интеллект модели». Его задача уже и практичнее: дать testbed для scalable oversight, где истина известна экспертам, но плохо проверяется обычным наблюдателем. Ниже — разбор именно работы Rein et al. в её исходной версии 2023–2024 годов, без подмены более поздними leaderboard-цифрами.

Коротко

  • GPQA задуман как benchmark для задач, где модель может знать больше проверяющего, а простой веб-поиск не даёт надёжной верификации.
  • В основной версии GPQA — 448 вопросов; авторы также описывают более широкий набор GPQA Extended на 546 вопросов и более строгий поднабор GPQA Diamond на 198 вопросов.
  • По статье и официальной карточке датасета, эксперты в релевантных областях достигают 65% accuracy, skilled non-experts с доступом к вебу — 34%, а сильнейший GPT-4 baseline на релизе — 39%.
  • «Google-proof» здесь не означает «ответ невозможно найти в интернете». Это означает, что даже подготовленный человек вне своей области, имея время и веб-доступ, всё равно часто не может собрать и проверить ответ.
  • Главные ограничения GPQA: узкий научный домен, multiple-choice формат, selection effects на subset-оценках людей и неизбежное старение любого публичного benchmark.

Контекст

Большая часть популярных QA-benchmark’ов измеряет либо знакомство модели с публичными экзаменационными данными, либо способность воспроизводить ответы, которые легко проверяются поиском. Для продуктовой оценки это полезно, но для задач научного ассистирования и AI safety — не всегда. Если модель отвечает на вопрос, который человек без узкой подготовки не умеет быстро верифицировать, возникает разрыв между answering и oversight.

Именно в этот разрыв и целится GPQA. Авторы опираются на линию работ о scalable supervision/oversight: как проверять более сильную систему, если судья слабее по знаниям или времени. В классической формулировке проблемы это обсуждалось ещё в Concrete Problems in AI Safety, а затем — в протоколах вроде AI safety via debate. GPQA нужен не как очередной «экзамен для LLM», а как лабораторный стенд для таких режимов проверки.

Важно и то, чем GPQA не является. Это не benchmark общего знания, не симулятор настоящего научного исследования и не окончательный тест «рассуждения». Это узко поставленная среда: есть правильный ответ, он известен экспертам, distractor-опции сделаны правдоподобными, а неэксперт с вебом всё равно часто ошибается.

Метод

Сильная сторона работы — не только сами вопросы, но и способ их сбора. Авторы набирали исполнителей через Upwork и требовали, чтобы «эксперты» уже имели PhD или учились в PhD-программе по своей области. Вопросы покрывают три крупные области: biology, physics и chemistry.

  1. Написание вопроса. Эксперт формулирует сложный вопрос внутри своей специализации, добавляет четыре варианта ответа и объяснение: почему один вариант верный и почему остальные выглядят правдоподобно.
  2. Первая экспертная проверка. Другой эксперт в той же области пытается ответить и оставляет подробный фидбек по корректности, ясности и сложности.
  3. Ревизия. Автор вопроса дорабатывает формулировку после первой проверки.
  4. Вторая экспертная проверка. Ещё один эксперт решает уже исправленную версию. Это нужно не только для accuracy, но и для оценки того, насколько вопрос объективен и имеет неоспоримо правильный ответ.
  5. Проверка неэкспертами. Три сильных валидатора из других научных областей решают тот же вопрос с неограниченным доступом к интернету, но без LLM-ассистентов. По статье, минимум был 15 минут на вопрос, а среднее время составило 37 минут при медиане 30 минут.

Отсюда и появляется термин Google-proof. Он не про магический запрет на поиск, а про эмпирический факт: неэкспертам разрешили пользоваться вебом, но это всё равно не превратило задачу в тривиальную retrieval-задачу.

Авторы публикуют несколько сплитов. По таблице 2 статьи, GPQA Extended содержит 546 вопросов. GPQA как основной набор — 448 вопросов; в него не включают случаи, где вопрос, по сути, провалил критерии «объективен и труден». GPQA Diamond — самый строгий поднабор на 198 вопросов, где отбор по экспертному согласию и неуспеху неэкспертов ещё жёстче.

Отдельная важная деталь — защита от leakage. В статье есть просьба не публиковать примеры вопросов в открытом виде, в репозитории присутствует canary string, а официальный датасет на Hugging Face gated. Это не делает contamination невозможным, но показывает, что авторы осознавали проблему ещё на релизе.

Результаты

Ниже — ключевые числа по исходной статье Rein et al.; таблица сведена по таблицам 2 и 5 и дополнительно совпадает со вторичным разбором AICAT News. Для оценок людей на main и diamond авторы сами ставят пометку о selection effects.

Сплит Как отбирался Вопросов Эксперты, % Неэксперты, % GPT-4 few-shot CoT, % GPT-4 with search, %
GPQA Extended Полный релизный набор 546 64.8 34.1 38.7 39.4
GPQA (main) Минимум частичное согласие экспертов и ограниченный успех неэкспертов 448 71.9* 30.4* 39.7 41.0
GPQA Diamond Самый строгий фильтр по экспертному согласию и неуспеху неэкспертов 198 81.3* 22.1* 38.8 38.8

*Авторская пометка: оценки людей на main и diamond смещены из-за самого способа отбора вопросов в эти поднаборы.

Самая заметная цифра в релизе — разрыв между экспертами и всеми остальными. По статье и официальной карточке датасета, эксперты в релевантной области достигают 65% accuracy, а skilled non-experts с веб-доступом — только 34%. Сильнейший baseline авторов, GPT-4, выходит примерно на 39%: то есть чуть выше неэксперта, но заметно ниже эксперта.

Это делает GPQA особенно интересным именно для протоколов supervision. Если модель была бы слабее неэксперта, benchmark мало что говорил бы о будущем oversight. Если бы модель уже уверенно превосходила эксперта, задача была бы другой. На релизе GPQA попал в промежуточную зону: модель уже не тривиальна, но доверять ей вслепую нельзя.

Отдельно показателен open-book режим. По таблице 5, search-версия GPT-4 почти не улучшает результат на Extended относительно few-shot CoT: 39.4% против 38.7%. При этом в статье авторы отдельно пишут, что search-сетап часто воздерживался от ответа, и им пришлось делать backoff к обычному few-shot CoT-ответу. Это важная деталь: слабый прирост от поиска здесь нельзя читать как доказательство, что retrieval бесполезен вообще; это скорее результат конкретного инструментария и prompting-схемы в статье.

По таблице 3 статьи, GPQA неоднороден и по доменам. На Extended biology даёт 105 вопросов, physics — 227, chemistry — 214. Самый большой expert–non-expert gap авторы фиксируют в chemistry: 40.6 процентного пункта против 23.5 в biology и 24.8 в physics. То есть benchmark не просто «сложный в среднем», а по-разному нагружает разные типы научной подготовки.

Интерпретация

Наш комментарий

GPQA полезен тем, что бьёт не по одному навыку, а по связке навыков. Чтобы хорошо отвечать на такие вопросы, системе мало помнить учебниковый факт. Нужно распознать, какой именно кусок доменного знания релевантен, не попасться на правдоподобные distractor-опции, а в open-book режиме ещё и правильно использовать внешние источники.

Для практиков это означает следующее: GPQA стоит читать не как «чистый benchmark рассуждения», а как смесь из доменного знания, научной грамотности, careful reasoning и tool use. В этом смысле он ближе к реальной работе научного ассистента, чем многие академические exam-benchmark’и, но всё ещё остаётся контролируемой задачей с фиксированным множественным выбором.

Ещё один важный вывод: GPQA измеряет не только способность модели ответить, но и сложность человеческой проверки. Это редкий случай, когда benchmark встроенно моделирует проблему надзора: у судьи есть интернет, время и высокий общий уровень подготовки, но этого всё равно недостаточно для надёжной верификации.

Ограничения

1. Узкий охват доменов. GPQA ограничен biology, physics и chemistry. Это плюс для контроля качества, но минус для обобщения: нельзя автоматически переносить выводы на право, медицину, программирование или междисциплинарные инженерные задачи.

2. Multiple-choice формат упрощает реальную науку. Авторы старались писать вопросы так, чтобы на них можно было отвечать и без вариантов, но в статье основная оценка всё равно multiple-choice. Это значит, что benchmark проверяет выбор среди правдоподобных альтернатив, а не построение ответа с нуля.

3. Объективность оценена не идеально. В статье авторы консервативно оценивают долю вопросов с неоспоримо правильным ответом на уровне 74% для Extended, причём это именно оценка для полного набора, а не прямое измерение для всех поднаборов. Для main и diamond авторы ожидают более высокую объективность, но это уже вывод по логике фильтрации, а не отдельное число, независимо измеренное на тех же условиях.

4. Human scores на main и diamond нельзя читать буквально. Поскольку эти сплиты уже отфильтрованы по экспертному согласию и неуспеху неэкспертов, рост expert accuracy и падение non-expert accuracy там частично заложены самой процедурой отбора. Авторы это прямо оговаривают.

5. Open-book baseline зависит от реализации. Небольшой выигрыш GPT-4 с поиском в этой работе не доказывает общий предел tool-augmented reasoning. Он показывает только то, что конкретный search-пайплайн Rein et al. не превращал GPQA в простую задачу. Другой агентный контур, другие запросы к поиску и другой механизм чтения источников могут дать иную картину.

6. Любой публичный benchmark стареет. GPQA вышел уже с защитой от leakage — gated release, canary string, просьба не публиковать вопросы открыто, — но ни одна такая мера не вечна. Если benchmark долго живёт в экосистеме, на него начинают влиять contamination, fine-tuning и оптимизация под leaderboard.

Вывод

GPQA важен не потому, что «самый умный» или «самый сложный» benchmark вообще, а потому что он аккуратно формализует редкую и полезную постановку: вопрос знает эксперт, модель может быть полезнее неэксперта, а веб-поиск не снимает проблему проверки. Для исследований human-AI oversight это намного ближе к реальной боли, чем обычные экзаменационные наборы.

Если вам нужен короткий итог, он такой: GPQA — это benchmark не про голую память и не про чистую математику, а про пределы научной верификации под ограничениями человека. Именно поэтому его стоит читать вместе с методологией сбора, а не только с leaderboard-цифрами.

Источники

FAQ

Почему GPQA называют «вопросами, которые не гуглятся»?

Потому что авторы проверяли не только модель, но и сильных неэкспертов с доступом к интернету. Если даже такой валидатор часто не может надёжно собрать ответ, задача выходит за рамки простого веб-поиска.

Чем GPQA отличается от обычного exam-benchmark?

Не только сложностью. Ключевое отличие — процедура валидации: вопрос должен быть одновременно объективным для эксперта и трудным для неэксперта с веб-доступом. Это делает benchmark полезным для supervision-сценариев, а не только для «оценки знаний».

Что такое GPQA Diamond?

Это самый строгий поднабор GPQA. В него попадают только вопросы, где экспертное согласие высокое, а неэксперты в большинстве случаев ошибаются. Поэтому Diamond удобен как «чистый» subset, но его human scores смещены самим способом отбора.

Можно ли считать GPQA тестом рассуждения?

Частично да, но не в изоляции. Он проверяет смесь доменного знания, научной грамотности, careful reasoning и работы с источниками. Сводить его только к reasoning benchmark было бы слишком грубо.

Читайте также