Запись архива

OpenAI представила PaperBench — бенчмарк для оценки способности ИИ воспроизводить AI-исследования

OpenAI запустила PaperBench — бенчмарк, в котором агенты должны воспроизвести 20 докладов ICML 2024 с нуля. Лучший результат показал Claude 3.5 Sonnet — 21%, тогда как PhD-исследователи набрали 41%. Бенчмарк включает 8316 задач и предназначен для оценки автономности ИИ в научной работе.

Диаграмма методологии бенчмарка PaperBench от OpenAI с разбивкой на 8316 подзадач
Диаграмма методологии бенчмарка PaperBench от OpenAI с разбивкой на 8316 подзадач
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

OpenAI опубликовала PaperBench — новый бенчмарк, предназначенный для измерения того, насколько хорошо AI-агенты могут самостоятельно воспроизводить современные научные исследования в области машинного обучения. Результаты показывают, что даже лучшие на текущий момент модели далеки от уровня человека-исследователя.

Что такое PaperBench и как он устроен

PaperBench представляет собой набор из 20 задач, каждая из которых требует от AI-агента полного воспроизведения одной из статей, принятых на ICML 2024 в категориях Spotlight и Oral. Это не просто тест на понимание текста: агенту нужно разобраться в вкладе работы, самостоятельно разработать кодовую базу и успешно выполнить эксперименты, чтобы получить результаты, сопоставимые с опубликованными.

Ключевая особенность PaperBench — иерархическая система рубрик (rubrics), которая разбивает каждую задачу на более мелкие, четко определенные подзадачи. Всего бенчмарк содержит 8316 индивидуально оцениваемых подзадач. Эти рубрики разрабатывались совместно с авторами оригинальных статей ICML, чтобы гарантировать точность и реалистичность оценки. Это позволяет превратить субъективную оценку качества репликации в объективное измерение.

Чтобы сделать процесс оценки масштабируемым, OpenAI также разработала LLM-судью, который автоматически оценивает попытки репликации на основе рубрик. Для валидации работы этого судьи был создан отдельный бенчмарк, оценивающий точность самого судьи.

Результаты тестирования: агенты против людей

OpenAI протестировала несколько передовых моделей на PaperBench. Лучший результат среди протестированных агентов показала модель Claude 3.5 Sonnet (New) от Anthropic, работающая с открытым скриптовым каркасом (open-source scaffolding). Ее средний балл репликации составил 21.0%.

Для сравнения, команда OpenAI также привлекла ведущих PhD-исследователей в области машинного обучения для попытки выполнить подмножество задач PaperBench. Человеческий результат оказался значительно выше — 41%. Это означает, что ни одна из протестированных моделей пока не превзошла человеческий уровень в этой задаче.

Важно отметить, что PaperBench намеренно сложен. Он проверяет не просто знание фактов, а способность к инженерной реализации и глубокому пониманию научной работы. Низкие баллы AI-агентов подчеркивают, что текущие системы все еще испытывают значительные трудности с задачами, требующими длительной цепочки рассуждений, планирования и отладки.

Контекст и место PaperBench среди других бенчмарков

PaperBench не существует в вакууме. Он является частью растущей экосистемы бенчмарков для оценки автономных научных способностей ИИ. Например, недавно появился ResearchClawBench, который оценивает способность агентов проводить полный цикл научного исследования, начиная с сырых данных. Другой бенчмарк, MLReplicate, фокусируется на генерации полных научных рукописей и выявил, что 59% автоматически принятых рецензий содержали сфабрикованные или неподтвержденные утверждения.

Эти параллельные усилия показывают, что сообщество осознает критическую важность надежных методов оценки для прогресса в области автономных научных исследований. PaperBench решает задачу «снизу вверх», начиная с воспроизведения существующих работ, в то время как другие бенчмарки пытаются оценить полный исследовательский цикл.

PaperBench и безопасность ИИ

OpenAI прямо связывает PaperBench со своей Программой оценки готовности (Preparedness Framework). Возможность ИИ автономно проводить исследования в области машинного обучения — это важный индикатор роста его возможностей. С одной стороны, это может ускорить научный прогресс, с другой — создает новые риски, которые необходимо тщательно изучать.

Способность агента воспроизвести сложное исследование — это шаг к созданию систем, которые смогут самостоятельно делать новые открытия. PaperBench предоставляет измеримый способ отслеживать прогресс в этом направлении, что критически важно для обеспечения безопасного развития ИИ.

Что это значит для разработчиков и исследователей

Для практикующих специалистов PaperBench — это не просто абстрактный тест. Он демонстрирует текущий предел возможностей AI-агентов в задачах, требующих глубокого понимания и инженерной реализации. Если вы планируете делегировать агенту задачу по воспроизведению сложного эксперимента из научной статьи, PaperBench показывает, что на данный момент результат, скорее всего, будет неполным или ошибочным.

Однако бенчмарк также служит ориентиром. По мере того как модели будут улучшать свои показатели на PaperBench, можно будет ожидать, что их способность помогать в реальной исследовательской работе будет расти. Для тех, кто работает над созданием AI-агентов, PaperBench предоставляет четкий и воспроизводимый набор задач для тестирования.

Ограничения и как использовать результаты

Важно понимать, что PaperBench оценивает способность к репликации, а не к оригинальному научному творчеству. Высокий балл на этом бенчмарке не означает, что агент может делать новые открытия. Кроме того, бенчмарк сфокусирован на 20 конкретных статьях из одной конференции, что может не отражать полный спектр задач в области ML.

Для объективной оценки прогресса необходимо комбинировать результаты PaperBench с результатами других бенчмарков, таких как ResearchClawBench или SWE-bench. Каждый из них проверяет разные аспекты автономности агента.

Источники