GeneBench-Pro: почему 31,5% успешных ответов — важный результат, но не доказательство готовности ИИ к науке

Новый бенчмарк проверяет не знание биологических фактов, а способность пройти цепочку статистических решений на реалистичных задачах. Лучший опубликованный результат GPT-5.6 Sol Pro — 31,5% успешных оценок — показывает заметный прогресс, но и значительный разрыв между отдельным верным наблюдением и надежным анализом.

Схема GeneBench-Pro показывает последовательность статистических решений при анализе биологических данных
Схема GeneBench-Pro показывает последовательность статистических решений при анализе биологических данных
eurofighter ladoscuro | by machacon | openverse | by

Главный результат GeneBench-Pro — не то, что одна модель обошла другую, а то, насколько трудно даже сильным системам пройти полный путь от постановки научного вопроса до обоснованного численного ответа. В опубликованном описании GPT-5.6 Sol набрала 28,7% успешных оценок, а GPT-5.6 Sol Pro — 31,5%. Это заметно выше 16,0% у указанной авторами сильнейшей модели вне линейки GPT, но означает и обратное: в большинстве проверок система не завершила задачу правильно.

Бенчмарк, представленный как расширенная версия GeneBench, посвящен многоэтапному статистическому рассуждению в геномике, количественной биологии и трансляционной биомедицине. Его ценность — в проверке цепочки решений, а не способности модели воспроизвести научный факт или запустить заранее заданный конвейер. Однако цифры следует читать как результаты конкретного теста, а не как рейтинг общей научной пригодности моделей или прогноз качества реальных исследований.

Тестируют не эрудицию, а выбор анализа

В типичной задаче GeneBench-Pro агент получает краткий контекст, целевую величину, которую нужно оценить, и минимум подсказок о том, как это сделать. Затем ему предстоит пройти несколько зависимых этапов: разобраться в данных, выбрать подходящий метод, проверить предположения и выдать ответ, пригодный для численной оценки. Ошибка на развилке может изменить весь дальнейший анализ, даже если последующие вычисления выполнены аккуратно.

Именно это отличает бенчмарк от простого экзамена по биологии. Для реальной исследовательской работы недостаточно знать, что определенный метод существует. Нужно понять, применим ли он к конкретной выборке и вопросу, позволяют ли данные оценить нужную величину и что делать, если диагностика противоречит первоначальному плану.

В описании авторов проблемы относятся к десяти основным областям и 21 конечной подкатегории. Набор ориентирован прежде всего на геномику, но также охватывает количественную биологию и трансляционную медицину. Формулировка «профессиональная задача» здесь обозначает тип рассуждения, который пытается воспроизвести тест; сама по себе она не подтверждает, что прохождение бенчмарка эквивалентно работе квалифицированного специалиста.

Почему неправильное решение может выглядеть убедительно

Самая важная диагностическая деталь в описании GeneBench-Pro — разрыв между замечанием сигнала и действием в ответ на него. По сообщению авторов, модели способны выявить локальный признак в данных, но не всегда переносят его последствия на последующий выбор метода. В результате агент может выбрать неподходящий оцениватель или продолжить первоначально правдоподобный, но неверный план анализа.

Это полезный взгляд на одну из слабостей научных агентов. Ошибка не обязательно проявляется как очевидная бессмыслица. Ответ может содержать корректные термины, последовательные вычисления и убедительное объяснение, но опираться на решение, несовместимое с данными или целевой оценкой. В научной работе такая ошибка особенно опасна, если итог затем превращается в основание для следующего эксперимента или медицинского решения.

Поэтому важен не только финальный балл. Бенчмарк пытается сделать измеряемой способность согласовывать промежуточные выводы: меняют ли результаты проверки качества данных выбранную модель, приводит ли обнаруженное ограничение к пересмотру анализа, прекращает ли агент следовать стратегии, когда она перестает соответствовать задаче. Это более содержательный объект проверки, чем ответ на отдельный вопрос, хотя и его измерение зависит от конструкции тестовых случаев.

Что говорят опубликованные результаты

В доступном описании полной версии из 129 оценок приводятся следующие показатели: GPT-5.6 Sol — 28,7% на максимальном уровне рассуждений; GPT-5.6 Sol Pro — 31,5% в отдельно обозначенных запусках GPT Pro; GPT-5.5 — 12,0%; GPT-5.4 — 8,9%; Claude Opus 4.8 — 16,0%. Все эти цифры приведены в описании самого исследования. Независимое воспроизведение каждого результата в предоставленных материалах не показано.

Модель Успешные оценки по описанию GeneBench-Pro
GPT-5.6 Sol 28,7%
GPT-5.6 Sol Pro 31,5%
GPT-5.5 12,0%
GPT-5.4 8,9%
Claude Opus 4.8 16,0%

Отрыв GPT-5.6 Sol от Claude Opus 4.8 в этой таблице составляет 12,7 процентного пункта. Но сравнение не следует расширять до утверждения, что модель лучше выполняет научные исследования в целом. Оно относится к конкретному набору задач, правилам оценивания и условиям запусков, указанным в исследовании. Кроме того, Sol Pro и Sol представлены как отдельные режимы или варианты запусков; без дополнительных подробностей нельзя трактовать разницу между ними как чистый эффект одной настройки.

Даже наилучший результат остается ниже одной трети оценок. Это не значит, что модель бесполезна: успешность на сложных многоэтапных задачах может быть существенно труднее, чем выполнение изолированных подзадач. Но и представлять такой результат как готовность к самостоятельной работе в лаборатории было бы неверно. Бенчмарк измеряет прохождение теста, а не ответственность за выбор экспериментального решения.

Как устроен набор и что он защищает

По описанию авторов, в GeneBench-Pro 129 оценок: 29 новых задач добавлены, три исключены, а 54 из 100 пересекающихся с прежним набором существенно переработаны. Внешние эксперты проверили 82 задачи; их замечания привели к изменениям формулировок, данных и дизайна там, где целевой ответ был недостаточно определим.

Такой пересмотр важен для научного теста. Если условия задачи не позволяют установить, какой результат считается обоснованным, низкий балл может отражать недостаток самого задания, а не модели. Экспертная проверка помогает обнаруживать такие случаи, но не устраняет все вопросы: качество бенчмарка зависит от того, насколько разнообразны ситуации, корректны эталонные ответы и соответствует ли их сложность реальной практике.

Из 129 задач десять внешне проверенных задач опубликованы открыто. Пятьдесят отложенных задач были переданы Artificial Analysis для независимого стороннего тестирования; оставшаяся часть, согласно описанию, сохранена во внутреннем отложенном наборе. Это разделение может затруднить прямую подгонку моделей под видимые примеры. Вместе с тем доступные сведения не дают полной картины независимой проверки всех опубликованных результатов на закрытой части теста.

Иными словами, в дизайне есть меры против слишком поверхностного прочтения — экспертная проверка и отложенные задачи, — но они не превращают один набор в универсальный эталон. Для уверенного сравнения нужно знать, как именно проведены запуски, какие инструменты были доступны, насколько повторяемы результаты и как оценивается частично правильный анализ. Доступное описание дает отдельные важные сведения, но не позволяет снять все эти вопросы.

Что мы можем перепроверить по самим числам

Минимальная редакционная проверка — пересчитать неразрыв между моделью и практическим порогом, не вводя выдуманных тестов. Например, 31,5% успешных оценок у GPT-5.6 Sol Pro означают, что до отметки в половину задач остается 18,5 процентного пункта. У GPT-5.6 Sol этот разрыв равен 21,3 пункта. Это арифметика по опубликованным результатам, а не отдельная оценка качества моделей.

Можно проверить и величину преимущества лидера над указанным сильнейшим не-GPT-результатом: 31,5% против 16,0% дают разницу 15,5 процентного пункта для сравнения Sol Pro с Claude Opus 4.8. Но если сравнивать Sol без Pro-обозначения, разница составляет 12,7 пункта. Выбор строки меняет вывод, поэтому нельзя объединять результаты под общим ярлыком «GPT-5.6» без пояснения.

Этот маленький аудит показывает, что у теста есть два разных редакционных сообщения. Первое — конкретный разрыв между опубликованными показателями моделей в выбранной задаче. Второе — абсолютная доля успешных оценок, указывающая, что серия решений остается сложной для всех представленных систем. Для лаборатории второе может быть не менее важно первого: высокая позиция в рейтинге не равна надежности на каждом отдельном анализе.

Практический смысл для исследовательских команд

Сейчас GeneBench-Pro разумнее использовать как перечень проверочных вопросов для внедрения, а не как основание передать модели анализ без надзора. Перед применением агента в работе команда может уточнить: способен ли он обосновать выбор целевой величины, выявляет ли ограничения выборки, меняет ли метод после диагностического сигнала и отделяет ли результат вычисления от вывода, который из него действительно следует.

Практический сценарий — поручить модели подготовку чернового плана анализа или поиск потенциальных альтернатив, а затем требовать от исследователя проверки критических решений. Особенно внимательно нужно проверять переходы между этапами: корректно ли сформулирована оценка, соответствует ли ей статистический метод, учтены ли структура выборки и ограничения данных. Это не отдельная рекомендация, выведенная из испытаний на людях, а осторожное применение того класса ошибок, который описывают авторы бенчмарка.

Для команд, сравнивающих модели, важна воспроизводимость. Условия теста нужно фиксировать: версию модели, уровень рассуждений, инструменты, доступ к данным и правила оценки. Если меняется хоть один из этих факторов, результат нельзя считать прямым повторением прежнего измерения. А для реальных задач полезно проверять не только итоговый численный ответ, но и корректность промежуточных решений — как раз там, по описанию авторов, модели часто теряют связь между сигналом и действием.

Где заканчивается доказательная сила GeneBench-Pro

Главный контраргумент против слишком скептического чтения прост: даже частичный успех на сложной цепочке решений может быть полезен, особенно если система помогает сократить рутинную работу или быстро находит кандидатов для последующей проверки. Бенчмарк также может направить разработчиков к конкретной слабости — способности пересматривать стратегию, — вместо расплывчатого вопроса о «научном интеллекте».

Но опубликованный балл сам по себе не показывает, насколько система надежна на новых данных, насколько безопасно ей поручать конкретную область и сколько времени она экономит специалисту. В пакете нет результатов пользовательского испытания в лабораторной среде, независимой оценки последствий решений или свидетельства, что прохождение теста улучшило реальные научные выводы. Поэтому такие выводы нельзя приписывать GeneBench-Pro.

Сильнее всего картину изменили бы независимые повторные оценки на отложенных задачах, подробные результаты по типам ошибок и проверки на реальных рабочих процессах с участием экспертов. Пока же вывод более узкий, но содержательный: GeneBench-Pro переводит в измеримый тест важную часть научной работы — последовательный выбор анализа, — а опубликованные результаты одновременно показывают прогресс моделей и сохраняющийся разрыв между нахождением сигнала и надежным решением.

Источники