Запись архива

AI-со-клиницист Google DeepMind: многообещающий прототип, но не новый врач

Google DeepMind предлагает модель «триадной помощи», в которой ИИ работает с пациентом под контролем врача. Результаты на 98 клинических запросах и в симуляциях с аудио и видео выглядят обнадеживающе, но пока не доказывают безопасность системы в реальной медицине.

Интерфейс симуляции телемедицинского разговора с AI co-clinician, пациентом и врачом под контролем Google DeepMind
Интерфейс симуляции телемедицинского разговора с AI co-clinician, пациентом и врачом под контролем Google DeepMind
File:Envisioning emerging technology for 2012 and beyond.png | by Michell Zappa | openverse | by-sa

Google DeepMind представила не готового медицинского ассистента, а исследовательскую архитектуру, в которой ИИ должен стать третьим участником взаимодействия между врачом и пациентом. Первые результаты выглядят сильнее обычной демонстрации возможностей языковой модели: в слепом сравнении врачи предпочитали ответы системы ведущим инструментам синтеза доказательств, а в проверке 98 реалистичных запросов первичной помощи в 97 случаях не было зафиксировано критических ошибок. Но эти данные получены на специально подготовленных сценариях и не заменяют испытаний в реальной клинической практике.

Главный вопрос поэтому звучит не так: «Может ли модель поставить диагноз?» Гораздо важнее другое: сможет ли она расширить возможности врача, не забирая у него ответственность, и при этом не создавать новый канал для пропущенных симптомов, неверных рекомендаций или утечки медицинских данных. Публикация Google DeepMind дает основания исследовать такой формат, но пока не дает оснований считать его доказанным безопасным стандартом.

От чат-бота к «триадной помощи»

В Google DeepMind называют следующую возможную стадию медицинского ИИ «триадной помощью»: пациент взаимодействует с AI-агентом, но действует тот под клиническим руководством врача. Это отличается и от обычного чат-бота для пациента, и от вспомогательного инструмента, который работает только внутри медицинской информационной системы.

Модель предполагает распределение ролей. Врач сохраняет клиническое суждение и контроль, пациент получает более доступный канал коммуникации, а ИИ берет на себя часть работы: собирает сведения, объясняет инструкции, помогает провести отдельные наблюдения и быстро синтезирует медицинские данные. В теории такой подход может увеличить охват системы здравоохранения без попытки заменить специалиста.

Идея логична, поскольку медицина уже построена на командной работе. В команде участвуют врачи разных специальностей, медсестры, лаборатории, регистратура и цифровые системы. Однако у ИИ есть принципиальное отличие от человека-коллеги: он способен уверенно сформулировать ошибочный ответ, а ответственность за последствия остается у медицинского специалиста.

Google DeepMind связывает инициативу с предыдущими проектами. Med-PaLM был ориентирован на проверку медицинских знаний в формате экзаменационных задач. AMIE исследовала текстовые симуляции медицинских консультаций и, по утверждению компании, достигала уровня врачей в некоторых сравнительных оценках. Новая концепция добавляет к этому не только помощь врачу, но и непосредственное взаимодействие с пациентом, причем потенциально в аудио- и видеорежиме.

Это важный сдвиг в постановке задачи. Успех на тесте знаний еще не означает надежную работу в консультации. Консультация состоит из неполных жалоб, неясных формулировок, неверно понятых вопросов, меняющихся симптомов и контекста, который трудно свести к одному запросу. AI co-clinician пытается оценивать именно более сложную цепочку взаимодействия.

Что именно проверили на клинических запросах

Первое направление исследования — помощь врачу в поиске и синтезе медицинских доказательств. Для оценки Google DeepMind вместе с академическими врачами адаптировала методологию NOHARM. В ней учитываются два класса проблем:

  • ошибки действия — когда система сообщает неверную информацию;
  • ошибки бездействия — когда она не упоминает важный факт, предупреждение или вариант, который следовало учесть.

В медицинских системах второй класс особенно опасен. Очевидно неправильный совет врач может заметить и перепроверить. Пропуск противопоказания, тревожного симптома или альтернативного объяснения может выглядеть гораздо убедительнее и остаться незамеченным.

Компания сообщает о слепом сравнении ответов AI co-clinician с ответами ведущих инструментов синтеза доказательств. Врачи, по ее утверждению, последовательно предпочитали ответы AI co-clinician. В отдельном объективном анализе использовали 98 реалистичных запросов первичной медицинской помощи. Запросы собрали из разных источников, затем доработали коллегией практикующих врачей. Для каждого сценария разработали собственные критерии оценки ответа.

В 97 из 98 случаев система, согласно Google DeepMind, не допустила критических ошибок. Формулировка существенна: это не означает, что все 98 ответов были полностью правильными, исчерпывающими или пригодными для назначения лечения. Она сообщает только о результате по наиболее тяжелой категории ошибок и оставляет пространство для менее серьезных неточностей, неполноты или спорных формулировок. Оставшийся случай публикация в предоставленном описании отдельно не раскрывает, поэтому делать вывод о его характере нельзя.

Методика выглядит более содержательной, чем простая проверка по ключевым словам. Сценарии проходили экспертную доработку, а для оценки использовали метрики, завязанные на конкретный клинический контекст. Это позволяет проверять не только совпадение ответа с эталонным текстом, но и пропуски, которые важны именно в данной ситуации.

Но у такого дизайна есть предел. Сценарии были заранее отобраны и отредактированы врачами. В реальной практике запрос может быть коротким, противоречивым, написанным с ошибками или дополненным данными из истории болезни, которые модель неверно интерпретирует. Кроме того, экспертный консенсус не всегда равен единственно правильному решению: в медицине встречаются допустимые варианты тактики, зависящие от ресурсов, локальных протоколов и предпочтений пациента.

Слепое сравнение также отвечает на вопрос о полезности ответов для оценщиков, но не на вопрос о влиянии инструмента на исход лечения. Врачи могли выбрать более ясный и лучше структурированный ответ, однако это еще не показывает, что при его использовании пациенты выздоравливают быстрее или реже получают осложнения.

Лекарства: более реалистичный тест, чем multiple choice

Второе направление — вопросы о лекарствах и терапевтических вмешательствах. Google DeepMind проверила систему на наборе RxQA из открытого массива OpenFDA. Это сложный тест медицинских знаний и рассуждений о препаратах.

Компания отмечает важную особенность исходного теста. RxQA первоначально был сформулирован как набор вопросов с выбором ответа, причем даже врачи первичной помощи показывали на нем лишь умеренные результаты. В таком формате модель может использовать стратегию исключения вариантов и не обязана формулировать полноценный клинический ответ.

Поэтому исследователи дополнительно оценивали открытые вопросы — в том виде, в каком они появляются в реальной работе. Врач обычно спрашивает не «какой из четырех вариантов правильный», а, например, как учесть сопутствующее заболевание, что делать при пропуске дозы, какие взаимодействия проверить или чем отличается риск для конкретной группы пациентов.

Google DeepMind сообщает, что AI co-clinician заметно улучшила результаты на тестах RxQA и особенно хорошо показала себя в открытом формате по сравнению с другими передовыми моделями. Однако в предоставленных материалах нет полного набора чисел, доверительных интервалов, списка сравниваемых систем и разбивки ошибок по типам. Поэтому корректно говорить о заявленном преимуществе, но не о независимо установленном превосходстве.

Здесь есть и более практическое ограничение. Ответ о лекарстве редко существует сам по себе. Для него нужны возраст, масса тела, беременность, функция почек и печени, аллергии, сопутствующие препараты, диагноз и цель лечения. Даже точный общий ответ может стать опасным, если система не видит одного из этих параметров или считает его несущественным.

Таким образом, сильный результат на RxQA показывает способность работать с фармакологическими знаниями и формулировать ответы. Он не доказывает, что модель корректно извлечет полный контекст из электронной карты пациента или безопасно предложит изменение терапии.

Глаза, уши и голос — пока в симуляции

Текстовые консультации ограничивают медицинский ИИ. Врач оценивает не только слова пациента, но и походку, характер дыхания, движения, внешний вид кожи, способность выполнить инструкцию. Поэтому Google DeepMind исследует мультимодальный режим на базе Gemini и Project Astra.

В техническом исследовании компания моделировала телемедицинские разговоры с живыми аудио- и видеоданными. В рандомизированной симуляции использовали 20 синтетических клинических сценариев и 10 актеров, изображавших пациентов. Это позволило проверить, как система ведет разговор и дает инструкции в реальном времени.

В опубликованном описании приведены два показательных примера. AI co-clinician смогла поправить технику использования ингалятора и провести пациента через движения плеча, которые могут помочь выявить повреждение вращательной манжеты. В таких случаях ценность системы состоит не в том, что она «видит диагноз», а в способности последовательно попросить человека выполнить действие и оценить результат.

Это уже более интересная задача, чем текстовый вопрос-ответ. Система должна понять речь, выбрать следующий вопрос, дать понятную инструкцию, обработать визуальную информацию и не потерять клинический контекст. Ошибка может возникнуть на каждом этапе: пациент неправильно держит камеру, плохое освещение скрывает изменение кожи, микрофон искажает дыхание, а модель принимает ограниченное движение за нормальное.

Но слово «симуляция» здесь нельзя считать формальностью. Синтетические сценарии и актеры позволяют стандартизировать тест и повторить его, однако не воспроизводят разнообразие реальных пациентов. Люди с разными акцентами, нарушениями слуха, тревогой, когнитивными особенностями или несколькими заболеваниями одновременно могут взаимодействовать с системой иначе. Кроме того, демонстрация правильной ингаляционной техники не равна доказательству улучшения контроля астмы.

Пока корректнее воспринимать мультимодальный режим как исследовательский прототип для телемедицины, а не как автономный дистанционный осмотр. Критически важно, чтобы пациент понимал: присутствие ИИ в разговоре не означает, что врач передал ему право принимать клинические решения.

Почему независимые данные пока не подтверждают главный тезис

В предоставленном пакете есть несколько внешних ориентиров, но они не образуют независимую валидацию именно AI co-clinician.

Публикация в Science упомянута только названием результата без описания методики и чисел. Ссылка на пост Nature в Facebook также содержит лишь заголовок о двух независимых моделях, способных помогать в нескольких задачах. Использовать такие материалы как доказательство безопасности или превосходства конкретной системы нельзя: отсутствуют детали дизайна, выборки, критерии и связь с AI co-clinician.

Более содержательный независимый материал — исследование, опубликованное в открытом доступе и посвященное сравнению 16 генеративных моделей на медицинских заметках из MIMIC-IV-Note. В нем Gemma-3-27B показала лучший общий результат в экстрактивном суммировании, а DeepSeek-R1-70B, Qwen-3-32B и GPT-4o были среди лидеров в абстрактивном. Авторы также учитывали время обработки, стоимость и возможность развертывания.

Это полезное напоминание: медицинская модель может быть сильной в одном типе задач и заметно слабее в другом. Суммирование заметки не равно ведению консультации, а лингвистические метрики не измеряют клиническую безопасность. Результаты MIMIC-IV не подтверждают заявление Google DeepMind о co-clinician, но показывают, какие параметры придется оценивать при практическом внедрении: точность, полноту, стоимость, задержку и пригодность к развертыванию.

Отдельно Google DeepMind развивает MedGemma — семейство открытых моделей для медицинского текста и изображений. Компания перечисляет среди возможных применений анализ КТ, МРТ, гистологических изображений, рентгенограмм грудной клетки, лабораторных отчетов и навигацию по медицинским записям через FHIR. При этом сама документация MedGemma предупреждает, что модели требуют валидации и адаптации под конкретный сценарий, а их выводы не предназначены для прямого использования при диагностике, ведении пациента или назначении лечения.

Это ограничение согласуется с более осторожным прочтением инициативы AI co-clinician. Название описывает роль системы в рабочем процессе, но не превращает универсальную модель в сертифицированное медицинское устройство. Для каждого применения понадобится отдельная проверка.

Небольшой редакционный аудит: что доказано, а что нет

Чтобы не смешивать разные уровни свидетельств, удобно разложить заявления Google DeepMind по четырем вопросам.

Первый: умеет ли система формулировать медицинские ответы? Да, это поддерживают тесты на клинических запросах и RxQA, хотя подробные результаты доступны не полностью.

Второй: предпочитают ли врачи ее ответы альтернативам? Компания сообщает, что в слепой оценке врачи предпочитали ответы AI co-clinician ведущим инструментам синтеза доказательств. Это свидетельство воспринимаемого качества, но не измерение клинического исхода.

Третий: умеет ли система взаимодействовать с пациентом через видео и голос? В рамках симуляции — да. Это подтверждено 20 синтетическими сценариями и 10 актерами-пациентами. Масштаб ограничен, а реальные пациенты и реальные диагнозы в описании не фигурируют.

Четвертый: безопасна ли система для самостоятельного использования? Нет, представленные данные этого не доказывают. Более того, сама концепция строится вокруг клинического надзора, а материалы о MedGemma прямо требуют специальной валидации и не разрешают трактовать вывод модели как прямое клиническое решение.

Такой аудит меняет тональность новости. Это не «ИИ научился лечить пациентов», а «Google DeepMind предложила набор исследовательских компонентов для совместной работы врача, пациента и модели и показала первые результаты на экспертно подготовленных тестах и симуляциях».

Что придется решить до реального внедрения

Для больницы главным препятствием станет не демонстрация разговора, а управление рисками. Система должна ясно показывать, какие данные она использовала, какие сведения пропустила и где уверенность недостаточна. Врач должен иметь возможность быстро проверить первоисточник, отменить рекомендацию и понять, почему модель задала именно этот вопрос.

Нужен и журнал действий: какие сообщения получил пациент, какие инструкции дал агент, какие сигналы тревоги обнаружил и когда подключился врач. Без такой трассировки расследовать ошибку будет трудно. Для мультимодального режима добавляются вопросы согласия на обработку видео и аудио, хранения записей и доступа к ним.

Особенно сложной будет граница между информационной поддержкой и клиническим решением. Объяснить назначение препарата — одно. Сказать пациенту прекратить терапию, вызвать скорую или подождать до планового визита — уже действие с потенциальными последствиями. Чем больше автономии получает агент, тем важнее заранее определить перечень разрешенных операций и обязательных случаев эскалации к врачу.

Есть и проблема неравенства доступа. AI co-clinician может расширить помощь там, где не хватает специалистов, но может одновременно ухудшить положение пациентов с нестабильным интернетом, редкими языками, ограниченными возможностями или низкой цифровой грамотностью. Мультимодальность не решает эти проблемы автоматически.

Наконец, потребуется сравнивать не только модель с моделью, но и рабочие процессы. Правильный контрольный вариант — не обязательно другой чат-бот. Им может быть врач с обычным поиском, медсестра с существующим протоколом, телефонная служба или комбинация этих инструментов. Важно измерять время до помощи, количество пропущенных тревожных признаков, нагрузку на персонал, повторные обращения и реальные исходы пациентов.

Вердикт: сильная гипотеза, еще не медицинский продукт

Инициатива Google DeepMind интересна тем, что ставит ИИ на место участника медицинской команды, а не универсального электронного врача. Оценка ошибок действия и бездействия, открытые вопросы о лекарствах и мультимодальные симуляции — более зрелый набор проверок, чем один экзаменационный бенчмарк.

Одновременно доказательная база остается ограниченной. Ключевой тест проведен на 98 специально подготовленных запросах, мультимодальный эксперимент — на 20 синтетических сценариях с 10 актерами, а часть сравнительных заявлений опубликована без подробных чисел и независимого воспроизведения. Внешние материалы из пакета подтверждают общий прогресс медицинских моделей, но не валидируют конкретно AI co-clinician.

Вывод может измениться, если появятся проспективные исследования в реальных клиниках с разнородными пациентами, заранее зарегистрированными критериями безопасности, полным учетом ошибок бездействия и сравнением с обычной практикой. Особенно важны результаты, показывающие не только предпочтение врачей, но и влияние на диагнозы, назначения, время ожидания и состояние пациентов.

До этого AI co-clinician стоит рассматривать как перспективную исследовательскую платформу для работы под контролем врача. Ее главный потенциал — снять часть информационной и коммуникационной нагрузки. Ее главный риск — создать иллюзию, что убедительный разговор и хороший результат на тесте уже равны надежной медицинской помощи. Между этими двумя вещами Google DeepMind еще предстоит пройти самый важный этап — проверку в реальной практике.

Источники