Медицинский совет от ChatGPT: лучшее рассуждение ещё не делает его врачом

OpenAI заявляет, что GPT-5.5 Instant лучше справляется с вопросами о здоровье благодаря рассуждению, контексту и оценкам с участием врачей. Но независимый тест 22 моделей показал: даже лучшая верно определяла нужный уровень помощи лишь в 74% случаев.

На экране ChatGPT показан ответ о здоровье рядом со шкалой срочности обращения за медицинской помощью
На экране ChatGPT показан ответ о здоровье рядом со шкалой срочности обращения за медицинской помощью
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Главный вывод из обещаний OpenAI об улучшении ChatGPT в вопросах здоровья не в том, что чат-бот стал безопасной заменой врачу, а в том, что компания пытается сделать его ответы полезнее именно в одной из самых рискованных повседневных областей. Это важное направление, но имеющиеся независимые данные не позволяют считать такие улучшения гарантией точного совета. В исследовании 22 версий ChatGPT лучшая модель верно определяла требуемый уровень помощи в 74% случаев; авторы заключили, что точности недостаточно для самостоятельного применения.

OpenAI связывает улучшения GPT-5.5 Instant с более сильным рассуждением, учётом контекста и ясной подачей, а также с оценками при участии врачей. Это описание подхода компании, а не независимое доказательство того, что новый вариант лучше распознаёт опасные симптомы или реже даёт вредные рекомендации. В предоставленных данных нет результатов отдельного сравнительного теста GPT-5.5 Instant по медицинским сценариям. Поэтому разумнее говорить не «ChatGPT теперь знает медицину», а «разработчик заявляет о повышении качества, которое ещё важно проверить на конкретных задачах».

Полезность и надёжность — разные характеристики

Медицинский ответ может звучать спокойно, быть хорошо структурирован и учитывать перечисленные пользователем обстоятельства, но всё равно ошибаться в главном: насколько срочно нужна помощь. Для здоровья это различие принципиально. Понятное объяснение может помочь подготовиться к разговору с врачом, тогда как неверная оценка срочности способна повлиять на то, обратится ли человек за помощью сегодня или отложит её.

В аннотации независимого исследования описан конкретный способ проверить именно эту границу. Исследователи оценивали 22 модели ChatGPT на 45 проверенных клинических сценариях. Каждый сценарий задавали десять раз, получив в сумме 9900 оценок. Модели должны были отнести ситуацию к одной из трёх категорий: экстренная помощь, неэкстренное обращение к врачу или самопомощь. Эталонные ответы для случаев определили два врача.

Лучший результат, согласно описанию исследования, показала o1-mini: точность составила 74%. Это не результат GPT-5.5 Instant, и переносить его на новый продукт нельзя. Но цифра показывает, почему одного обещания «лучше рассуждает» недостаточно. Даже при заданной классификации, подготовленных случаях и врачебном эталоне лучший из проверенных вариантов не достиг безошибочности. Более того, исследователи не обнаружили общего улучшения по мере появления новых моделей. Модели с рассуждением лучше справлялись с распознаванием ситуаций, подходящих для самопомощи, но это не означало общего превосходства во всех категориях.

У этого теста есть ограничения. Клинические виньетки — стандартизированные истории, а не полный разговор с человеком, чья ситуация меняется во времени. Тест измеряет классификацию срочности, а не все возможные применения чат-бота: объяснение термина, подготовку вопросов к врачу или помощь в понимании инструкции. Поэтому он не доказывает, что ChatGPT бесполезен для здоровья. Но он проверяет один из наиболее важных для безопасности вопросов — способен ли сервис надёжно подсказать, когда нужно обратиться за помощью, — и не даёт оснований считать ответ безошибочным.

Что именно утверждает OpenAI — и чего из этого не следует

В описании релиза GPT-5.5 Instant OpenAI выделяет несколько направлений: улучшенное рассуждение, более качественное использование контекста, более ясную коммуникацию и оценки, сформированные с участием врачей. Каждое может иметь практическую ценность. Если система лучше удерживает детали разговора, ей проще не терять упомянутые симптомы или ограничения. Если яснее объясняет ответ, человеку легче понять, что она советует. Оценки с участием медицинских специалистов могут помочь разработчикам заметить типичные ошибки.

Но это направления работы, а не доказательство клинической пригодности. Участие врачей в оценке не означает, что врачи проверяют каждый ответ, который получает пользователь. Более ясный ответ не обязательно точнее. Хорошее рассуждение по неполным данным тоже может привести к ошибке: модель не осматривает пациента и не может автоматически восполнить информацию, которую пользователь не знает или не сообщил.

Это различие важно ещё и потому, что в системе ChatGPT модельный ответ может зависеть от того, какая модель обрабатывает запрос. В описании системы GPT-5 говорится об архитектуре с быстрой и более глубоко рассуждающей моделями и маршрутизатором, который выбирает вариант с учётом типа и сложности беседы, потребности в инструментах и явного намерения пользователя. Это описание GPT-5 в предоставленной системной карточке, а не подтверждение конкретного маршрута для каждого медицинского вопроса в GPT-5.5 Instant. Практический смысл общий: одно название продукта не обязательно означает одинаковый способ обработки каждого запроса, а пользователь не должен считать, что важный вопрос автоматически получил «максимальное рассуждение».

Для оценки улучшения нужны прямые данные: какие случаи проверяли, с чем сравнивали новую модель, как оценивали ошибки и менялась ли способность правильно распознавать ситуации, требующие срочной помощи. Пока таких цифр в доступных материалах нет, заявление о прогрессе следует воспринимать именно как позицию разработчика, а не как окончательный вердикт о безопасности.

Не всякое медицинское применение одинаково рискованно

Разговоры о «медицинских советах ИИ» часто сваливают в одну категорию слишком разные задачи. Попросить объяснить, что означает незнакомый термин в выписке, — не то же самое, что описать боль в груди и спросить, можно ли подождать до завтра. Ошибка в объяснении слова может запутать; ошибка в оценке срочности потенциально меняет решение о помощи.

Поэтому полезно разделить сценарии по последствиям.

Низкорисковое применение — попросить объяснить общедоступный медицинский термин простыми словами, составить список вопросов к специалисту или помочь разобраться в структуре документа. Даже здесь стоит перепроверять медицинские факты и не вводить идентифицирующие личные данные без необходимости.

Средний риск — обсуждение возможных объяснений симптомов, взаимодействий лекарств или вариантов действий. Здесь ответ лучше использовать как список тем для проверки с врачом или фармацевтом, а не как персональное назначение. Значение имеют детали, которых система может не знать: сопутствующие заболевания, возраст, дозировка, аллергии, беременность и другие лекарства.

Высокий риск — решение о том, нужна ли экстренная помощь, можно ли отменить назначенное лечение или безопасно ли самостоятельно переждать ухудшение. Именно здесь ошибка может отложить обращение за помощью. Независимый тест с оценкой срочности не подтверждает, что ChatGPT достаточно точен для такого решения в одиночку.

Это не означает, что любую медицинскую информацию от чат-бота нужно игнорировать. Вопрос в том, какую роль ей отвести. ИИ может помочь сформулировать сомнения и подготовиться к консультации. Но если ответ становится единственным основанием отложить помощь или изменить лечение, пользователь перекладывает на инструмент ответственность, надёжность которой пока не установлена.

Почему разовый удачный ответ ничего не доказывает

В исследовании модели отвечали на каждый сценарий десять раз. Это полезная деталь: система не всегда выдаёт одинаковый ответ на один и тот же запрос. По описанию авторов, рекомендации моделей могли различаться, а сочетание нескольких ответов с алгоритмом агрегации улучшало точность на четыре процентных пункта. Однако это не превращает повторные запросы в домашний медицинский протокол.

Во-первых, это результат исследовательской процедуры с алгоритмом агрегации, а не обещание, что обычный пользователь, задавая один вопрос несколько раз, получит более безопасное решение. Во-вторых, если ответы расходятся, человеку без медицинской подготовки трудно определить, какой из них верен. В-третьих, повторение одного запроса не добавляет модели новых фактов о состоянии человека. Оно может показать нестабильность ответа, но не заменить осмотр или проверку.

Отсюда практическое правило: не использовать несколько уверенно звучащих ответов как голосование по поводу диагноза. Если ответы противоречат друг другу, это не повод выбирать самый успокаивающий. Это признак того, что инструмент не дал надёжного основания для решения.

Небольшой тест перед тем, как доверить ответ

Проверить медицинский ответ можно без попытки самостоятельно поставить диагноз. Это не клинический тест и не способ доказать, что модель надёжна. Задача — оценить, пригоден ли ответ как вспомогательный материал.

Сформулируйте вопрос как задачу для подготовки, а не как просьбу вынести окончательный вердикт. Например: «Какие сведения мне важно сообщить врачу?» или «Какие вопросы задать фармацевту об этом препарате?»

Уточните, какие данные отсутствуют. Если ответ уверенно рассуждает, не спросив о важных обстоятельствах, это не делает его точным. Напротив, такая уверенность должна побудить проверить, на чём основан вывод.

Попросите отделить известное от предположений: какие части ответа опираются на сообщённые факты, а какие — на общую информацию. Это может сделать ограничения заметнее, но само объяснение модели не является независимой проверкой.

Сверьте практические утверждения с подходящим профессиональным источником или специалистом. Особенно если речь о дозировке, сочетании препаратов, изменении лечения или решении об обращении за помощью.

При тревожных или быстро ухудшающихся симптомах не превращайте чат-бот в фильтр, который должен разрешить или запретить обращение. Решение о помощи лучше принимать с медицинским специалистом или экстренной службой, а не по одиночному ответу модели.

Такой подход сохраняет полезную функцию ChatGPT — объяснять, структурировать и помогать подготовиться — и не приписывает ему возможности, которых тесты не подтвердили. Он также учитывает разницу между качеством ответа как текста и качеством рекомендации как основания для действия.

Что могло бы изменить оценку

Для более уверенного вывода о GPT-5.5 Instant потребовалось бы сравнение с предыдущими моделями на одних и тех же медицинских сценариях. Важно видеть не только среднюю точность, но и ошибки по категориям срочности: например, насколько часто модель пропускает необходимость экстренной помощи, как часто, напротив, направляет за ней без необходимости и насколько стабилен результат при повторных запросах.

Полезны были бы подробности методики: кто составлял сценарии, как выбирали эталон, проверяли ли случаи эксперты независимо, как учитывали неопределённость и какие именно ответы засчитывали как правильные. Отдельный тест на понятность текста не заменил бы оценку клинической точности, как и врачебное участие в разработке само по себе не заменило бы опубликованных результатов.

Пока имеющиеся сведения дают две разные по статусу опоры. OpenAI сообщает о намерении улучшить медицинские ответы GPT-5.5 Instant с помощью рассуждения, контекста, ясной подачи и оценок с участием врачей. Независимое исследование других версий ChatGPT показывает, что в задаче определения срочности ошибки остаются существенными, а новая модель не обязательно автоматически лучше старой. Первая часть — обещание разработчика о продукте; вторая — измеренный результат для конкретного набора моделей и сценариев. Ни одна из них не доказывает, что ChatGPT бесполезен или что GPT-5.5 Instant уже опасен во всех медицинских задачах. Но вместе они поддерживают осторожную практическую позицию: использовать его для объяснений и подготовки, а не как единственного арбитра при решении, что делать со здоровьем.

Источники