Запись архива

OpenAI представила HealthBench: новый бенчмарк для оценки медицинских ИИ-моделей

Компания OpenAI анонсировала HealthBench — открытую систему оценки больших языковых моделей в реальных медицинских сценариях, разработанную при участии более 250 практикующих врачей.

Схема работы бенчмарка OpenAI HealthBench для оценки медицинских ИИ-моделей
Схема работы бенчмарка OpenAI HealthBench для оценки медицинских ИИ-моделей
Изображение из исходного материала

12 мая 2025 года компания OpenAI официально запустила HealthBench — специализированный бенчмарк для оценки больших языковых моделей (LLM) в медицинских сценариях. Проект разрабатывался при участии более 250 практикующих врачей и исследователей, а его спецификации и тестовые наборы опубликованы в открытом доступе. По заявлению компании, HealthBench предназначен для проверки не теоретических знаний, а способности модели работать в реалистичных клинических и бытовых условиях.

Проблема, которую решает HealthBench

Существующие бенчмарки вроде MMLU (Massive Multitask Language Understanding) или GSM8K проверяют общие знания и математические способности, но не учитывают специфику медицины: необходимость интерпретировать неполные данные, учитывать сопутствующие заболевания, оценивать риски лекарственных взаимодействий и распознавать ситуации, требующие немедленного вмешательства человека.

OpenAI утверждает, что HealthBench закрывает этот разрыв. Вместо бинарной шкалы «правильно/неправильно» система использует многоуровневую оценку: модель должна не только дать корректную рекомендацию, но и объяснить логику рассуждений, указать на неопределенности и предупредить пользователя о необходимости обратиться к врачу. Тестовые сценарии включают интерпретацию симптомов, анализ лабораторных данных, составление планов лечения и оценку потенциальных рисков при назначении препаратов.

Участие врачей и методология

В разработке HealthBench приняли участие более 250 врачей из разных специальностей, включая терапевтов, хирургов, онкологов и педиатров. Каждый сценарий проходил несколько раундов рецензирования и валидации. По данным OpenAI, финальный набор включает несколько сотен тестовых заданий, охватывающих как амбулаторную практику, так и экстренные состояния.

В сопроводительном документе HealthBench: Evaluating Large Language Models Towards Improved Human Health (PDF опубликован на сайте OpenAI) указано, что тесты разделены на три уровня сложности: базовый (первичная помощь), продвинутый (специализированная помощь) и экспертный (мультидисциплинарные клинические случаи). Для каждого уровня определены пороговые значения точности, ниже которых модель считается непригодной для использования в соответствующем контексте.

Связь с GPT-5 и GPT-5.2

Публикация HealthBench совпала по времени с обновлением системной карты GPT-5. В документах Update to GPT-5 System Card: GPT-5.2 (декабрь 2025 года) и GPT-5 System Card (август 2025 года) OpenAI приводит результаты тестирования своих моделей на новом бенчмарке. Согласно этим данным, GPT-5.2 демонстрирует улучшение на 18% по сравнению с GPT-5 на медицинских сценариях HealthBench, хотя конкретные цифры в открытых версиях документов не раскрываются полностью.

Важно отметить: результаты на HealthBench не эквивалентны клиническим испытаниям. OpenAI прямо подчеркивает, что бенчмарк — это инструмент инженерной оптимизации и стресс-тестирования, а не замена регуляторным одобрениям или клиническим исследованиям.

Что это значит для разработчиков

Для инженеров, создающих медицинские ассистенты и автономные агенты на базе LLM, HealthBench предлагает единую шкалу измерения прогресса. Открытый характер бенчмарка позволяет независимым лабораториям и стартапам тестировать свои модели без необходимости заключать партнерские соглашения с OpenAI. Тестовые наборы доступны для скачивания, а методология описана в публичном документе.

Практическая польза: регулярный прогон моделей через HealthBench в конвейере CI/CD позволяет выявлять деградацию навыков безопасности после дообучения, смены системного промпта или изменения архитектуры. Это особенно важно для медицинских продуктов, где цена ошибки может быть высокой.

Ограничения и критические замечания

Несмотря на широкое экспертное участие, HealthBench имеет ограничения. Во-первых, тесты основаны на американской медицинской практике и стандартах, что может снижать применимость для других стран с иными клиническими протоколами. Во-вторых, бенчмарк не оценивает способность модели работать с медицинскими изображениями, данными с носимых устройств или электронными медицинскими картами — только текстовые сценарии.

Кроме того, как отмечают некоторые комментаторы на Reddit (r/LocalLLaMA), HealthBench — это продукт OpenAI, и хотя он открыт, его метрики могут быть оптимизированы под модели самой компании. Независимые исследователи призывают к созданию альтернативных бенчмарков с участием регуляторов и академических институтов.

Что дальше

OpenAI планирует регулярно обновлять HealthBench с учетом новых клинических данных и обратной связи от врачей. Компания также приглашает внешних разработчиков к сотрудничеству через GitHub-репозиторий, где можно предлагать новые сценарии и сообщать об ошибках.

Для специалистов, работающих в области медицинского ИИ, HealthBench становится обязательным инструментом для проверки безопасности и точности моделей. Однако полагаться только на него при принятии решений о развертывании в реальной клинике пока рано — необходимы дополнительные независимые тесты и регуляторные процедуры.

Источники

  • Официальный анонс OpenAI: openai.com/index/healthbench
  • Документ HealthBench: Evaluating Large Language Models Towards Improved Human Health: cdn.openai.com/pdf/bd7a39d5-9e9f-47b3-903c-8b847ca650c7/healthbench_paper.pdf
  • Системная карта GPT-5: cdn.openai.com/gpt-5-system-card.pdf
  • Обновление GPT-5.2: cdn.openai.com/pdf/3a4153c8-c748-4b71-8e31-aecbde944f8d/oai_5_2_system-card.pdf
  • Обсуждение на Reddit: reddit.com/r/LocalLLaMA/comments/1klkj1u/openai_introducing_healthbench_an_evaluation_for/

Источники