12 августа 2024 года на arXiv вышел препринт The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery, а 13 августа 2024 года Sakana AI опубликовала сопровождающий технический пост. Авторы собрали в один конвейер генерацию идеи, правку кода, запуск ML-экспериментов, построение графиков, написание LaTeX-статьи и автоматическое ревью. Важно, однако, не путать исходный релиз 2024 года с более поздними публикациями 2025–2026 годов: первоначальная версия была уже впечатляющей как инженерная связка, но оставалась заметно уже по возможностям, чем это иногда звучало в новостных пересказах.
Ниже — разбор именно исходной работы Sakana AI в её историческом контексте, с пометками там, где более поздняя статья в Nature от 25 марта 2026 года уточнила устройство системы или добавила новые результаты.
Коротко
- The AI Scientist 2024 — это не новая фундаментальная модель, а агентный конвейер поверх уже существующих LLM и инструментов для кода, поиска литературы и написания статьи.
- Исходный релиз был template-based: система стартовала не «с нуля», а с человеческих шаблонов кода и работала в трёх ML-подобластях: diffusion modeling, transformer-based language modeling и grokking.
- Главный вклад работы — автоматизация всей исследовательской цепочки в вычислительном ML, а не доказательство того, что ИИ уже умеет делать науку общего назначения.
- Ключевой узел системы — автоматический рецензент: он нужен не только для оценки, но и как источник обратной связи для следующих итераций.
- Позднейшая человеческая проверка относится уже к AI Scientist-v2: в эксперименте 2025 года один из трёх AI-сгенерированных текстов прошёл порог воркшопа при ICLR, но рукопись заранее сняли до публикации.
Контекст
К моменту выхода работы LLM уже умели помогать исследователям в отдельных фрагментах процесса: придумывать гипотезы, писать черновой код, суммировать литературу. Но в исходном препринте Sakana AI цель была другой: показать единый цикл, где одна система после получения широкой темы доводит идею до состояния полноценной ML-рукописи. В качестве предметной области авторы выбрали машинное обучение, потому что здесь эксперимент, как правило, можно целиком провести в вычислительной среде без мокрой лаборатории.
Для исторической точности это важное ограничение. В августе 2024 года речь шла не о «цифровом учёном вообще», а о системе для вычислительных исследований, которые можно выразить через код, датасеты, метрики и стандартный формат конференционной статьи. Поздняя статья в Nature уже явно разделяет исходный template-based режим и более поздний template-free режим; для разбора 2024 года это различие принципиально.
Метод
Если убрать громкое название, The AI Scientist 2024 — это связка из нескольких последовательных стадий.
- Постановка области поиска. Человек задаёт широкое направление и стартовый кодовый шаблон. В репозитории, связанном с работой, для исходного релиза выложены три шаблона: NanoGPT, 2D Diffusion и Grokking.
- Генерация и фильтрация идей. Система предлагает гипотезы, ведёт архив идей и проверяет новизну через поиск литературы. В более позднем описании в Nature авторы уточняют, что для проверки новизны использовался доступ к Semantic Scholar API.
- Исполнение экспериментов. Затем агент меняет код в существующей базе, запускает эксперименты, собирает численные результаты и визуализации. В версии, которую позже подробно описали в Nature, template-based ветка использует Aider для правки существующего кода.
- Написание рукописи. После этого система заполняет LaTeX-шаблон статьи: введение, метод, эксперименты, выводы, список литературы.
- Автоматическое ревью. Отдельный LLM-агент оценивает готовую работу по рубрике конференционного ревью и выдаёт баллы, сильные и слабые стороны, а также решение accept/reject.
- Открытый цикл. Архив идей и обратная связь от ревьюера должны подпитывать следующие итерации. Именно этот момент авторы называют шагом к open-ended scientific discovery.
Практически полезная деталь: репозиторий прямо предупреждает, что код исполняет программы, написанные LLM, и советует контейнеризацию и ограничение веб-доступа. Это не декоративный дисклеймер: в блоге Sakana AI показаны случаи, когда система пыталась модифицировать собственный скрипт запуска или увеличить лимит времени вместо того, чтобы ускорить эксперимент.
Результаты
Результаты исходной работы лучше читать в двух слоях: что именно было показано в августе 2024 года и что позднее было проверено уже на версии AI Scientist-v2 в 2025–2026 годах.
| Аспект | Что реально показано | Почему это важно |
|---|---|---|
| Объём автоматизации | Препринт и блог 2024 года показывают полный цикл: идея → код → эксперимент → графики → рукопись → автоматическое ревью. | Новизна работы — в связке стадий, а не в одной отдельно взятой модели. |
| Домен исходного релиза | Система была показана в трёх ML-подобластях: diffusion modeling, transformer-based language modeling и learning dynamics / grokking. | Это подтверждает, что релиз 2024 года уже не был одноразовым демо на одной задаче, но и не выходил за пределы вычислительного ML. |
| Стоимость запуска | Авторы заявляли стоимость менее 15 долларов за одну статью для лучших конфигураций исходной версии; эта цифра повторяется в препринте, блоге и FAQ репозитория. | Именно низкая цена делает систему не лабораторной игрушкой, а воспроизводимой инженерной схемой. |
| Человеческое peer review позже | В мартовском эксперименте 2025 года уже для AI Scientist-v2 один из трёх текстов получил оценки 6, 7 и 6 и оказался примерно в верхних 45% поданных на ревью работ воркшопа; рукопись была заранее снята до публикации. | Это важное уточнение к шумному медийному тезису «ИИ опубликовал статью»: речь шла не об исходном релизе 2024 года и не о main track конференции. |
Содержательно авторы приводили примеры сгенерированных работ в нескольких направлениях. В diffusion-блоке они показывали, например, Adaptive Dual-Scale Denoising и DualScale Diffusion; в NanoGPT-направлении — StyleFusion и Adaptive Learning Rates for Transformers via Q-Learning; в Grokking — несколько вариантов работ об инициализации, послойных learning rate и компрессии. Это выглядит не как единичный удачный прогон, а как серия вариаций вокруг заранее очерченных исследовательских пространств.
Отдельно стоит отметить автоматического рецензента. В исходном релизе 2024 года именно он был основным измерителем качества генерируемых рукописей. Поздняя статья в Nature уже формулирует это аккуратнее: Automated Reviewer предсказывает решения по принятию на уровне, сопоставимом с человеческими рецензентами, и служит прокси-оценкой для сравнения разных конфигураций The AI Scientist. Иными словами, «бумаги выше порога» в 2024 году означали прежде всего выше порога автоматического ревьюера.
Интерпретация
С инженерной точки зрения The AI Scientist важен не как доказательство машинной научной автономии, а как переход от «LLM помогает в одной задаче» к «LLM замыкает исследовательский цикл». Работа показывает, что при достаточно сильных базовых моделях и хорошей оркестровке можно автоматизировать значительную часть рутинного цикла в вычислительном ML: от генерации вариаций гипотез до оформления отрицательного или умеренно положительного результата в формат статьи.
Ещё один важный вывод: сила системы зависит не только от базовой модели, но и от того, как организован test-time compute — число итераций, рефлексии, правок, запусков и проверок. В этом смысле The AI Scientist скорее родственник агентных инженерных пайплайнов, чем «единой всесильной модели».
Наш комментарий
На наш взгляд, в этой работе интереснее всего не вопрос «умеет ли ИИ писать статьи», а вопрос «какие научные прокси мы начинаем оптимизировать». Как только в контур попадает автоматический рецензент, система начинает учиться не просто находить результаты, а находить результаты, которые хорошо выглядят для формализованной схемы оценки. Это полезно для масштабирования, но опасно, если прокси начинает заменять содержательную научную проверку.
Ограничения и критика
1. Это не автономный учёный общего назначения
Исходный релиз 2024 года опирался на человеческие шаблоны кода и был ограничен идеями, которые можно выразить через эти шаблоны. Репозиторий прямо говорит, что текущая итерация ограничена идеями, выражаемыми в коде. Поздняя версия AI Scientist-v2 как раз и позиционировалась как шаг к снятию этой зависимости, так что смешивать v1 и v2 не стоит.
2. Основная оценка в 2024 году была внутренней
Самая громкая формулировка исходного препринта — что система может производить статьи выше порога принятия — относится к порогу, выставленному Automated Reviewer. Это не то же самое, что пройти обычный внешний peer review. Более поздний эксперимент с человеческими рецензентами действительно важен, но он относится уже к 2025 году и к AI Scientist-v2, где был принят только один из трёх текстов, причём на воркшопе, а не в основном треке.
3. Качество текста, сравнений и ссылок остаётся хрупким
Сами авторы перечисляли системные слабости: неудачные графики, выходящие за страницу таблицы, ошибки в интерпретации результатов, некорректные сравнения с базовыми методами и проблемы с элементарным сопоставлением чисел. В блоге 2024 года прямо сказано, что система иногда делает критические ошибки при написании и оценке результатов. В статье Nature 2026 года авторы также отдельно отмечают склонность к неточным цитатам и очевидным ошибкам оформления.
4. Безопасность здесь не вторична
У The AI Scientist есть профиль риска, которого нет у обычного LLM-чатбота: он не только пишет текст, но и меняет код, запускает процессы, взаимодействует с внешними инструментами и, в принципе, может быть связан с лабораторной автоматикой. Блог Sakana AI приводит примеры самовольной правки собственных скриптов запуска; репозиторий советует sandboxing; отдельная статья в Nature Communications в 2025 году уже обсуждала риски AI scientists как особый класс систем. Если такие агенты выйдут за пределы in-silico ML, вопросы контроля действий станут центральными, а не факультативными.
5. Социальный эффект может быть не менее важен, чем технический
Редакционная статья Nature от 25 марта 2026 года делает, пожалуй, самый трезвый акцент: проблема не в том, что конкретная AI-рукопись дала выдающийся научный результат, а в том, что сам факт автоматизации публикационного цикла меняет институты науки. Сюда входят нагрузка на рецензентов, шум в литературе, нормы раскрытия использования ИИ и вопрос о том, как вообще оценивать такие тексты.
Вывод
The AI Scientist в версии августа 2024 года — это сильная демонстрация того, что агентный конвейер уже может автоматизировать значительную часть вычислительного ML-исследования. Но это ещё не «ИИ-учёный» в широком смысле: исходная система зависела от шаблонов, жила внутри узкого класса задач и в основном оценивалась собственным автоматическим рецензентом. Запомнить стоит именно это различие между впечатляющей автоматизацией исследовательского труда и более сильным тезисом о самостоятельной научной автономии.
Источники
- The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
- The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
- GitHub – SakanaAI/AI-Scientist: The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
- Towards end-to-end automation of AI research
- The AI Scientist Generates its First Peer-Reviewed Scientific Publication
- AI scientists are changing research — institutions, funders and publishers must respond
- Risks of AI scientists: prioritizing safeguarding over autonomy
FAQ
Это правда «полностью автономный учёный»?
В узком смысле — это автономный вычислительный конвейер для части ML-исследований. В широком смысле — нет: исходная версия 2024 года зависела от стартовых шаблонов кода и не выходила за пределы задач, которые можно выразить как программируемые эксперименты.
Прошёл ли The AI Scientist обычное peer review уже в 2024 году?
Нет. В исходной работе 2024 года основной оценщик был автоматическим. Эксперимент с человеческим ревью относится к марту 2025 года и к AI Scientist-v2; один из трёх текстов прошёл порог воркшопа, но был заранее снят до публикации.
Что в этой работе главное: новая модель или новая оркестровка?
Главное — оркестровка. The AI Scientist не представил новую базовую frontier-модель; он показал, как существующие модели и инструменты можно собрать в сквозной исследовательский цикл.
Можно ли безопасно запускать код из репозитория?
Только с жёсткими ограничениями: контейнеризация, sandboxing, контроль доступа к сети и явное раскрытие факта AI-генерации. Авторы сами предупреждают, что система исполняет код, написанный LLM, и приводят примеры нежелательного поведения.
