Запись архива

AI co-scientist: как агенты Google выдвигают научные гипотезы

Разбираем AI co-scientist от Google: релиз 2025 года и peer-reviewed версия 2026-го. Как устроен мультиагентный «турнир идей», что показали оценки и где у работы границы.

Схема архитектуры Co-Scientist: исследователь задаёт цель, supervisor распределяет задачи, а агенты Generation, Reflection, Ranking, Evolution, Proximity и Meta-review спорят и дорабатывают гипотезы

AI co-scientist — система Google, впервые публично представленная 19 февраля 2025 года в блоге Google Research, а затем опубликованная 19 мая 2026 года в Nature под названием Co-Scientist. Важно не смешивать эти состояния: в статье ниже мы разбираем именно одну и ту же исследовательскую линию в ее историческом развитии, а не подменяем релиз 2025 года более поздними маркетинговыми обещаниями.

С технической точки зрения это не «автономный ученый», а мультиагентная надстройка над Gemini, где отдельные агенты генерируют, критикуют, ранжируют и дорабатывают гипотезы под заданную исследовательскую цель. Практический интерес работы в том, что авторы показали не только автоматические метрики, но и несколько мокрых лабораторных проверок в биомедицине.

Коротко

  • Исторический контур зафиксирован по датам: анонс Google Research — 19 февраля 2025 года; первая arXiv-версия — 26 февраля 2025 года; peer-reviewed публикация в Nature — 19 мая 2026 года.
  • Система строится как «ученый в контуре» (scientist-in-the-loop): человек задает цель и ограничения, а шесть специализированных агентов плюс supervisor исследуют пространство гипотез.
  • Главная инженерная идея — превратить выдвижение гипотез в итеративный поиск с test-time compute: идеи спорят между собой в турнире, затем лучшие эволюционируют в новые варианты.
  • По статье в Nature и синхронизированной arXiv-версии авторы сообщают о росте качества по Elo на 203 исследовательских целях, отдельной оценке на 15 сложных биомедицинских задачах и экспертной проверке на 11 задачах.
  • Сильная сторона работы — сочетание автоматических оценок и лабораторной валидации; слабая — небольшие экспертные выборки, субъективность части метрик и пока узкий домен реальных проверок.

Контекст

Проблема, на которую нацелен AI co-scientist, понятна любому практику: научная литература растет быстрее, чем человек успевает держать в голове связи между областями. Обычные LLM-инструменты хорошо суммируют известное, но хуже работают там, где нужно не пересказать публикации, а предложить правдоподобную и проверяемую новую гипотезу.

Google в релизе 2025 года прямо формулировала цель как выход за пределы «deep research» и обзора литературы: система должна не просто собирать материалы, а помогать с формулировкой новых гипотез и исследовательских планов. В версии Nature 2026 года это же утверждение переводится на более строгий язык: система должна предлагать novel, original research hypotheses, опираясь на цели исследователя и предыдущее знание.

Для практиков здесь важен еще один контекст: работа лежит на пересечении трех трендов 2024–2026 годов — reasoning-моделей, test-time compute и агентных систем. AI co-scientist интересен не тем, что «наконец-то сделал науку сам», а тем, что собрал эти тренды в один pipeline для открытой задачи, где качество нельзя свести к одному финальному ответу.

Метод

В раннем описании Google Research система названа multi-agent AI system на Gemini 2.0. В peer-reviewed версии архитектура описана как compound multi-agent system на Gemini с явным разбиением ролей между агентами и асинхронным исполнением задач.

Базовая схема такая:

  • Supervisor принимает цель ученого на естественном языке и распределяет вычислительные ресурсы.
  • Generation agent предлагает начальные направления и гипотезы.
  • Proximity agent следит, чтобы пространство идей не схлопывалось в несколько похожих вариантов.
  • Reflection agent играет роль виртуального рецензента: ищет пробелы, ошибки, сомнительные допущения.
  • Ranking agent устраивает попарные сравнения и научные дебаты между гипотезами.
  • Evolution agent комбинирует и дорабатывает сильные идеи, не перезаписывая старые.
  • Meta-review agent собирает паттерны из споров и формирует итоговый обзор направлений.

Ключевой инженерный ход — так называемый tournament of ideas. Вместо одного ответа модель производит множество кандидатов, затем сравнивает их попарно, выделяет победы и поражения, а после этого запускает эволюцию лучших вариантов. Это очень похоже на перенос логики test-time search из задач рассуждения в задачу научного поиска.

Важная деталь из статьи: система использует внешние инструменты, включая веб-поиск и специализированные AI-модели, когда это нужно для проверки правдоподобия. Для практиков это означает, что архитектура не полагается только на внутреннюю память базовой модели; она пытается заземлять новизну и корректность через внешние проверки.

Еще одна важная деталь — человеческий контур. Ученый может задавать ограничения, предлагать стартовые идеи, корректировать направление поиска и выбирать, какие топ-гипотезы вообще стоит нести в лабораторию. Это принципиально отличает систему от нарратива про «замену исследователя».

Результаты

Ниже — самое важное из результатов, с разделением между автоматическими оценками, экспертной оценкой и реальной экспериментальной проверкой. Числа ниже опираются как минимум на два источника: статью в Nature и синхронизированную arXiv-версию; для доменных кейсов добавлены связанные первоисточники по биомедицинским задачам.

Что проверяли Постановка Что сообщили авторы Как это читать
Масштабирование test-time compute 203 исследовательские цели, введенные в систему до 3 февраля 2025 года; гипотезы разбиты на 10 временных бакетов По мере времени вычислений росли и лучший Elo, и средний Elo top-10 гипотез Это аргумент в пользу итеративного поиска, но метрика здесь автооценочная, а не внешняя «истина»
Сравнение на сложных биомедицинских целях Подмножество из 15 экспертно подобранных задач; в турнире участвовали Co-Scientist, «best guess» экспертов и базовые модели Co-Scientist со временем обходил другие системы и экспертные стартовые гипотезы по Elo Сильный результат внутри авторской процедуры; важно, что Elo не является независимой ground truth-метрикой
Слепая экспертная оценка 11 из 15 задач; эксперты оценивали предпочтение, новизну и потенциальный импакт Средний ранг предпочтения — 2.36; оценки новизны и импакта — 3.64 и 3.09 из 5 Это уже человеческая оценка, но выборка мала и сами авторы подчеркивают субъективность
AML drug repurposing 30 топ-гипотез передали онкологам для отбора кандидатов на мокрую проверку Авторы сообщают о кандидатах и комбинациях для острого миелоидного лейкоза с in vitro-эффектом при клинически применимых концентрациях Это не клиническое испытание, а ранняя лабораторная валидация после экспертного отбора
Ливерный фиброз Эксперты выбрали три топ-направления по эпигенетическим мишеням; далее шли эксперименты на organoid-модели В связанной статье по фиброзу сообщается, что две рекомендованные AI co-scientist эпигеномные стратегии показали значимую антифибротическую активность; в версии arXiv/Nature также говорится о двух эффективных вариантах без клеточной токсичности Это один из самых предметных кейсов, потому что есть отдельная доменная публикация
Механизм переноса cf-PICI Системе дали вопрос о том, как cf-PICI распространяются между видами бактерий, при том что экспериментальный ответ еще не был опубликован Топ-гипотеза Co-Scientist совпала с подтвержденным механизмом: cf-PICI используют разнообразные фаговые хвосты для расширения host range Это, вероятно, самый сильный narrative-кейс работы, потому что он касается непубликованного результата, но это все еще единичный кейс

Отдельно стоит отметить исторический нюанс. Работа вошла в публичное поле в феврале 2025 года, но peer-reviewed статья вышла только 19 мая 2026 года. Поэтому для точности лучше говорить так: Google сначала показала исследовательский прототип AI co-scientist, а затем опубликовала более зрелую и расширенную версию Co-Scientist в Nature.

Интерпретация

Наш комментарий

На наш взгляд, главная новизна тут не в том, что модель «вдруг научилась быть ученым». Гораздо важнее другое: авторы превратили открытую задачу выдвижения гипотез в управляемый процесс поиска по пространству идей. Для ML-практика это означает, что ценность возникает не столько из одной более сильной базовой модели, сколько из композиции ролей, внешних инструментов и выделенного test-time compute.

Еще один важный вывод: система особенно сильна там, где можно формализовать исследовательскую цель, задать ограничения и потом ранжировать множество частично правдоподобных вариантов. Это делает архитектуру потенциально полезной не только для биомедицины, но и для R&D-задач в материалах, химии или прикладной инженерии. Но это именно потенциал, а не уже доказанный факт: реальные end-to-end проверки в статье в основном биомедицинские.

Для команды, которая хочет строить нечто похожее, урок простой: не пытайтесь сразу делать «AI-ученого целиком». Гораздо реалистичнее проектировать систему как набор специализированных рабочих ролей с явными интерфейсами между ними: генерация, критика, турнирное сравнение, эволюция и человеческий отбор.

Ограничения

  • Ключевая метрика — не объективная истина. Авторы прямо пишут, что Elo в этих экспериментах автооценивается и не является независимой ground truth. Поэтому рост Elo нельзя читать как прямой эквивалент роста научной истинности.
  • Экспертная оценка небольшая. Человеческая проверка проводилась на 11 из 15 заранее отобранных задач. В самой статье сказано, что из-за малого масштаба нужны дальнейшие исследования для надежных выводов.
  • Лабораторные кейсы — это ранняя, а не окончательная валидация. Для AML и фиброза речь идет об in vitro-экспериментах и экспертно отобранных кандидатах, а не о проспективном клиническом сравнении «AI против человека».
  • Генерализация по дисциплинам пока ограничена. Авторы подчеркивают general-purpose замысел, но реальные end-to-end демонстрации в статье сосредоточены преимущественно на биомедицине.
  • Есть риски галлюцинаций, смещения и гомогенизации поиска. В arXiv/Nature-версии авторы прямо упоминают imperfect factuality, potential hallucinations и риск того, что такие системы могут уменьшать критическое мышление или сужать разнообразие исследовательских направлений.
  • Безопасность описана предварительно. В приложении arXiv-версии сообщается о предварительной safety-проверке на наборе adversarial goals, но детальный датасет не опубликован. Это значит, что независимая проверка safety-утверждений пока ограничена.

Вывод

AI co-scientist важен не как доказательство появления «искусственного ученого», а как качественный пример того, как agentic-архитектуры можно прикладывать к открытым научным задачам. Работа показывает, что test-time compute, дебаты между агентами и внешние инструменты могут быть полезны не только на бенчмарках рассуждения, но и в выдвижении гипотез.

Но границы у этого результата тоже четкие. Сегодня это скорее тщательно спроектированный исследовательский сопилот с несколькими убедительными кейсами, чем универсальная машина научного открытия.

Источники

FAQ

Это уже «автономный ученый»?

Нет. По описанию авторов, это система для режима scientist-in-the-loop: человек задает цель, ограничения, корректирует направление и выбирает кандидатов на реальную проверку.

Чем AI co-scientist отличается от обычного deep research?

Не только сбором литературы. Главное отличие — мультиагентный цикл генерации, критики, турнирного ранжирования и эволюции гипотез, плюс использование test-time compute и внешних инструментов.

Доказывает ли статья, что такие системы умеют делать науку в общем случае?

Пока нет. Авторы показали убедительные результаты на ограниченном наборе задач, в основном биомедицинских, и сами отмечают предварительный характер части оценок.

Читайте также