AI co-scientist — система Google, впервые публично представленная 19 февраля 2025 года в блоге Google Research, а затем опубликованная 19 мая 2026 года в Nature под названием Co-Scientist. Важно не смешивать эти состояния: в статье ниже мы разбираем именно одну и ту же исследовательскую линию в ее историческом развитии, а не подменяем релиз 2025 года более поздними маркетинговыми обещаниями.
С технической точки зрения это не «автономный ученый», а мультиагентная надстройка над Gemini, где отдельные агенты генерируют, критикуют, ранжируют и дорабатывают гипотезы под заданную исследовательскую цель. Практический интерес работы в том, что авторы показали не только автоматические метрики, но и несколько мокрых лабораторных проверок в биомедицине.
Коротко
- Исторический контур зафиксирован по датам: анонс Google Research — 19 февраля 2025 года; первая arXiv-версия — 26 февраля 2025 года; peer-reviewed публикация в Nature — 19 мая 2026 года.
- Система строится как «ученый в контуре» (scientist-in-the-loop): человек задает цель и ограничения, а шесть специализированных агентов плюс supervisor исследуют пространство гипотез.
- Главная инженерная идея — превратить выдвижение гипотез в итеративный поиск с test-time compute: идеи спорят между собой в турнире, затем лучшие эволюционируют в новые варианты.
- По статье в Nature и синхронизированной arXiv-версии авторы сообщают о росте качества по Elo на 203 исследовательских целях, отдельной оценке на 15 сложных биомедицинских задачах и экспертной проверке на 11 задачах.
- Сильная сторона работы — сочетание автоматических оценок и лабораторной валидации; слабая — небольшие экспертные выборки, субъективность части метрик и пока узкий домен реальных проверок.
Контекст
Проблема, на которую нацелен AI co-scientist, понятна любому практику: научная литература растет быстрее, чем человек успевает держать в голове связи между областями. Обычные LLM-инструменты хорошо суммируют известное, но хуже работают там, где нужно не пересказать публикации, а предложить правдоподобную и проверяемую новую гипотезу.
Google в релизе 2025 года прямо формулировала цель как выход за пределы «deep research» и обзора литературы: система должна не просто собирать материалы, а помогать с формулировкой новых гипотез и исследовательских планов. В версии Nature 2026 года это же утверждение переводится на более строгий язык: система должна предлагать novel, original research hypotheses, опираясь на цели исследователя и предыдущее знание.
Для практиков здесь важен еще один контекст: работа лежит на пересечении трех трендов 2024–2026 годов — reasoning-моделей, test-time compute и агентных систем. AI co-scientist интересен не тем, что «наконец-то сделал науку сам», а тем, что собрал эти тренды в один pipeline для открытой задачи, где качество нельзя свести к одному финальному ответу.
Метод
В раннем описании Google Research система названа multi-agent AI system на Gemini 2.0. В peer-reviewed версии архитектура описана как compound multi-agent system на Gemini с явным разбиением ролей между агентами и асинхронным исполнением задач.
Базовая схема такая:
- Supervisor принимает цель ученого на естественном языке и распределяет вычислительные ресурсы.
- Generation agent предлагает начальные направления и гипотезы.
- Proximity agent следит, чтобы пространство идей не схлопывалось в несколько похожих вариантов.
- Reflection agent играет роль виртуального рецензента: ищет пробелы, ошибки, сомнительные допущения.
- Ranking agent устраивает попарные сравнения и научные дебаты между гипотезами.
- Evolution agent комбинирует и дорабатывает сильные идеи, не перезаписывая старые.
- Meta-review agent собирает паттерны из споров и формирует итоговый обзор направлений.
Ключевой инженерный ход — так называемый tournament of ideas. Вместо одного ответа модель производит множество кандидатов, затем сравнивает их попарно, выделяет победы и поражения, а после этого запускает эволюцию лучших вариантов. Это очень похоже на перенос логики test-time search из задач рассуждения в задачу научного поиска.
Важная деталь из статьи: система использует внешние инструменты, включая веб-поиск и специализированные AI-модели, когда это нужно для проверки правдоподобия. Для практиков это означает, что архитектура не полагается только на внутреннюю память базовой модели; она пытается заземлять новизну и корректность через внешние проверки.
Еще одна важная деталь — человеческий контур. Ученый может задавать ограничения, предлагать стартовые идеи, корректировать направление поиска и выбирать, какие топ-гипотезы вообще стоит нести в лабораторию. Это принципиально отличает систему от нарратива про «замену исследователя».
Результаты
Ниже — самое важное из результатов, с разделением между автоматическими оценками, экспертной оценкой и реальной экспериментальной проверкой. Числа ниже опираются как минимум на два источника: статью в Nature и синхронизированную arXiv-версию; для доменных кейсов добавлены связанные первоисточники по биомедицинским задачам.
| Что проверяли | Постановка | Что сообщили авторы | Как это читать |
|---|---|---|---|
| Масштабирование test-time compute | 203 исследовательские цели, введенные в систему до 3 февраля 2025 года; гипотезы разбиты на 10 временных бакетов | По мере времени вычислений росли и лучший Elo, и средний Elo top-10 гипотез | Это аргумент в пользу итеративного поиска, но метрика здесь автооценочная, а не внешняя «истина» |
| Сравнение на сложных биомедицинских целях | Подмножество из 15 экспертно подобранных задач; в турнире участвовали Co-Scientist, «best guess» экспертов и базовые модели | Co-Scientist со временем обходил другие системы и экспертные стартовые гипотезы по Elo | Сильный результат внутри авторской процедуры; важно, что Elo не является независимой ground truth-метрикой |
| Слепая экспертная оценка | 11 из 15 задач; эксперты оценивали предпочтение, новизну и потенциальный импакт | Средний ранг предпочтения — 2.36; оценки новизны и импакта — 3.64 и 3.09 из 5 | Это уже человеческая оценка, но выборка мала и сами авторы подчеркивают субъективность |
| AML drug repurposing | 30 топ-гипотез передали онкологам для отбора кандидатов на мокрую проверку | Авторы сообщают о кандидатах и комбинациях для острого миелоидного лейкоза с in vitro-эффектом при клинически применимых концентрациях | Это не клиническое испытание, а ранняя лабораторная валидация после экспертного отбора |
| Ливерный фиброз | Эксперты выбрали три топ-направления по эпигенетическим мишеням; далее шли эксперименты на organoid-модели | В связанной статье по фиброзу сообщается, что две рекомендованные AI co-scientist эпигеномные стратегии показали значимую антифибротическую активность; в версии arXiv/Nature также говорится о двух эффективных вариантах без клеточной токсичности | Это один из самых предметных кейсов, потому что есть отдельная доменная публикация |
| Механизм переноса cf-PICI | Системе дали вопрос о том, как cf-PICI распространяются между видами бактерий, при том что экспериментальный ответ еще не был опубликован | Топ-гипотеза Co-Scientist совпала с подтвержденным механизмом: cf-PICI используют разнообразные фаговые хвосты для расширения host range | Это, вероятно, самый сильный narrative-кейс работы, потому что он касается непубликованного результата, но это все еще единичный кейс |
Отдельно стоит отметить исторический нюанс. Работа вошла в публичное поле в феврале 2025 года, но peer-reviewed статья вышла только 19 мая 2026 года. Поэтому для точности лучше говорить так: Google сначала показала исследовательский прототип AI co-scientist, а затем опубликовала более зрелую и расширенную версию Co-Scientist в Nature.
Интерпретация
Наш комментарий
На наш взгляд, главная новизна тут не в том, что модель «вдруг научилась быть ученым». Гораздо важнее другое: авторы превратили открытую задачу выдвижения гипотез в управляемый процесс поиска по пространству идей. Для ML-практика это означает, что ценность возникает не столько из одной более сильной базовой модели, сколько из композиции ролей, внешних инструментов и выделенного test-time compute.
Еще один важный вывод: система особенно сильна там, где можно формализовать исследовательскую цель, задать ограничения и потом ранжировать множество частично правдоподобных вариантов. Это делает архитектуру потенциально полезной не только для биомедицины, но и для R&D-задач в материалах, химии или прикладной инженерии. Но это именно потенциал, а не уже доказанный факт: реальные end-to-end проверки в статье в основном биомедицинские.
Для команды, которая хочет строить нечто похожее, урок простой: не пытайтесь сразу делать «AI-ученого целиком». Гораздо реалистичнее проектировать систему как набор специализированных рабочих ролей с явными интерфейсами между ними: генерация, критика, турнирное сравнение, эволюция и человеческий отбор.
Ограничения
- Ключевая метрика — не объективная истина. Авторы прямо пишут, что Elo в этих экспериментах автооценивается и не является независимой ground truth. Поэтому рост Elo нельзя читать как прямой эквивалент роста научной истинности.
- Экспертная оценка небольшая. Человеческая проверка проводилась на 11 из 15 заранее отобранных задач. В самой статье сказано, что из-за малого масштаба нужны дальнейшие исследования для надежных выводов.
- Лабораторные кейсы — это ранняя, а не окончательная валидация. Для AML и фиброза речь идет об in vitro-экспериментах и экспертно отобранных кандидатах, а не о проспективном клиническом сравнении «AI против человека».
- Генерализация по дисциплинам пока ограничена. Авторы подчеркивают general-purpose замысел, но реальные end-to-end демонстрации в статье сосредоточены преимущественно на биомедицине.
- Есть риски галлюцинаций, смещения и гомогенизации поиска. В arXiv/Nature-версии авторы прямо упоминают imperfect factuality, potential hallucinations и риск того, что такие системы могут уменьшать критическое мышление или сужать разнообразие исследовательских направлений.
- Безопасность описана предварительно. В приложении arXiv-версии сообщается о предварительной safety-проверке на наборе adversarial goals, но детальный датасет не опубликован. Это значит, что независимая проверка safety-утверждений пока ограничена.
Вывод
AI co-scientist важен не как доказательство появления «искусственного ученого», а как качественный пример того, как agentic-архитектуры можно прикладывать к открытым научным задачам. Работа показывает, что test-time compute, дебаты между агентами и внешние инструменты могут быть полезны не только на бенчмарках рассуждения, но и в выдвижении гипотез.
Но границы у этого результата тоже четкие. Сегодня это скорее тщательно спроектированный исследовательский сопилот с несколькими убедительными кейсами, чем универсальная машина научного открытия.
Источники
- Accelerating scientific discovery with Co-Scientist — основная peer-reviewed статья в Nature.
- Accelerating scientific discovery with Co-Scientist — arXiv-версия с историей версий и подробным приложением.
- Accelerating scientific breakthroughs with an AI co-scientist — анонс Google Research от 19 февраля 2025 года.
- Co-Scientist: A multi-agent AI partner to accelerate research — пост Google DeepMind о peer-reviewed версии и практическом разворачивании.
- AI-Assisted Drug Re-Purposing for Human Liver Fibrosis — отдельная доменная статья по кейсу фиброза.
- AI mirrors experimental science to uncover a novel mechanism of gene transfer crucial to bacterial evolution — препринт по кейсу cf-PICI.
- Chimeric infective particles expand species boundaries in phage-inducible chromosomal island mobilization — экспериментальная статья в Cell, с которой сравнивали гипотезу Co-Scientist.
- Why AI cannot do good science without humans — редакционная статья Nature о границах таких систем.
FAQ
Это уже «автономный ученый»?
Нет. По описанию авторов, это система для режима scientist-in-the-loop: человек задает цель, ограничения, корректирует направление и выбирает кандидатов на реальную проверку.
Чем AI co-scientist отличается от обычного deep research?
Не только сбором литературы. Главное отличие — мультиагентный цикл генерации, критики, турнирного ранжирования и эволюции гипотез, плюс использование test-time compute и внешних инструментов.
Доказывает ли статья, что такие системы умеют делать науку в общем случае?
Пока нет. Авторы показали убедительные результаты на ограниченном наборе задач, в основном биомедицинских, и сами отмечают предварительный характер части оценок.
