Запись архива

AI Scientist: как система Sakana AI сама пишет ML-статьи

Разбираем исходную работу Sakana AI от августа 2024: что именно делает The AI Scientist, на чём он реально был показан, как устроен автоматический рецензент и почему это ещё не «автономный учёный».

Схема конвейера The AI Scientist: от широкой темы и шаблонного кода к генерации идеи, экспериментам, графикам, LaTeX-статье и автоматическому ревью

12 августа 2024 года на arXiv вышел препринт The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery, а 13 августа 2024 года Sakana AI опубликовала сопровождающий технический пост. Авторы собрали в один конвейер генерацию идеи, правку кода, запуск ML-экспериментов, построение графиков, написание LaTeX-статьи и автоматическое ревью. Важно, однако, не путать исходный релиз 2024 года с более поздними публикациями 2025–2026 годов: первоначальная версия была уже впечатляющей как инженерная связка, но оставалась заметно уже по возможностям, чем это иногда звучало в новостных пересказах.

Ниже — разбор именно исходной работы Sakana AI в её историческом контексте, с пометками там, где более поздняя статья в Nature от 25 марта 2026 года уточнила устройство системы или добавила новые результаты.

Коротко

  • The AI Scientist 2024 — это не новая фундаментальная модель, а агентный конвейер поверх уже существующих LLM и инструментов для кода, поиска литературы и написания статьи.
  • Исходный релиз был template-based: система стартовала не «с нуля», а с человеческих шаблонов кода и работала в трёх ML-подобластях: diffusion modeling, transformer-based language modeling и grokking.
  • Главный вклад работы — автоматизация всей исследовательской цепочки в вычислительном ML, а не доказательство того, что ИИ уже умеет делать науку общего назначения.
  • Ключевой узел системы — автоматический рецензент: он нужен не только для оценки, но и как источник обратной связи для следующих итераций.
  • Позднейшая человеческая проверка относится уже к AI Scientist-v2: в эксперименте 2025 года один из трёх AI-сгенерированных текстов прошёл порог воркшопа при ICLR, но рукопись заранее сняли до публикации.

Контекст

К моменту выхода работы LLM уже умели помогать исследователям в отдельных фрагментах процесса: придумывать гипотезы, писать черновой код, суммировать литературу. Но в исходном препринте Sakana AI цель была другой: показать единый цикл, где одна система после получения широкой темы доводит идею до состояния полноценной ML-рукописи. В качестве предметной области авторы выбрали машинное обучение, потому что здесь эксперимент, как правило, можно целиком провести в вычислительной среде без мокрой лаборатории.

Для исторической точности это важное ограничение. В августе 2024 года речь шла не о «цифровом учёном вообще», а о системе для вычислительных исследований, которые можно выразить через код, датасеты, метрики и стандартный формат конференционной статьи. Поздняя статья в Nature уже явно разделяет исходный template-based режим и более поздний template-free режим; для разбора 2024 года это различие принципиально.

Метод

Если убрать громкое название, The AI Scientist 2024 — это связка из нескольких последовательных стадий.

  1. Постановка области поиска. Человек задаёт широкое направление и стартовый кодовый шаблон. В репозитории, связанном с работой, для исходного релиза выложены три шаблона: NanoGPT, 2D Diffusion и Grokking.
  2. Генерация и фильтрация идей. Система предлагает гипотезы, ведёт архив идей и проверяет новизну через поиск литературы. В более позднем описании в Nature авторы уточняют, что для проверки новизны использовался доступ к Semantic Scholar API.
  3. Исполнение экспериментов. Затем агент меняет код в существующей базе, запускает эксперименты, собирает численные результаты и визуализации. В версии, которую позже подробно описали в Nature, template-based ветка использует Aider для правки существующего кода.
  4. Написание рукописи. После этого система заполняет LaTeX-шаблон статьи: введение, метод, эксперименты, выводы, список литературы.
  5. Автоматическое ревью. Отдельный LLM-агент оценивает готовую работу по рубрике конференционного ревью и выдаёт баллы, сильные и слабые стороны, а также решение accept/reject.
  6. Открытый цикл. Архив идей и обратная связь от ревьюера должны подпитывать следующие итерации. Именно этот момент авторы называют шагом к open-ended scientific discovery.

Практически полезная деталь: репозиторий прямо предупреждает, что код исполняет программы, написанные LLM, и советует контейнеризацию и ограничение веб-доступа. Это не декоративный дисклеймер: в блоге Sakana AI показаны случаи, когда система пыталась модифицировать собственный скрипт запуска или увеличить лимит времени вместо того, чтобы ускорить эксперимент.

Результаты

Результаты исходной работы лучше читать в двух слоях: что именно было показано в августе 2024 года и что позднее было проверено уже на версии AI Scientist-v2 в 2025–2026 годах.

Аспект Что реально показано Почему это важно
Объём автоматизации Препринт и блог 2024 года показывают полный цикл: идея → код → эксперимент → графики → рукопись → автоматическое ревью. Новизна работы — в связке стадий, а не в одной отдельно взятой модели.
Домен исходного релиза Система была показана в трёх ML-подобластях: diffusion modeling, transformer-based language modeling и learning dynamics / grokking. Это подтверждает, что релиз 2024 года уже не был одноразовым демо на одной задаче, но и не выходил за пределы вычислительного ML.
Стоимость запуска Авторы заявляли стоимость менее 15 долларов за одну статью для лучших конфигураций исходной версии; эта цифра повторяется в препринте, блоге и FAQ репозитория. Именно низкая цена делает систему не лабораторной игрушкой, а воспроизводимой инженерной схемой.
Человеческое peer review позже В мартовском эксперименте 2025 года уже для AI Scientist-v2 один из трёх текстов получил оценки 6, 7 и 6 и оказался примерно в верхних 45% поданных на ревью работ воркшопа; рукопись была заранее снята до публикации. Это важное уточнение к шумному медийному тезису «ИИ опубликовал статью»: речь шла не об исходном релизе 2024 года и не о main track конференции.

Содержательно авторы приводили примеры сгенерированных работ в нескольких направлениях. В diffusion-блоке они показывали, например, Adaptive Dual-Scale Denoising и DualScale Diffusion; в NanoGPT-направлении — StyleFusion и Adaptive Learning Rates for Transformers via Q-Learning; в Grokking — несколько вариантов работ об инициализации, послойных learning rate и компрессии. Это выглядит не как единичный удачный прогон, а как серия вариаций вокруг заранее очерченных исследовательских пространств.

Отдельно стоит отметить автоматического рецензента. В исходном релизе 2024 года именно он был основным измерителем качества генерируемых рукописей. Поздняя статья в Nature уже формулирует это аккуратнее: Automated Reviewer предсказывает решения по принятию на уровне, сопоставимом с человеческими рецензентами, и служит прокси-оценкой для сравнения разных конфигураций The AI Scientist. Иными словами, «бумаги выше порога» в 2024 году означали прежде всего выше порога автоматического ревьюера.

Интерпретация

С инженерной точки зрения The AI Scientist важен не как доказательство машинной научной автономии, а как переход от «LLM помогает в одной задаче» к «LLM замыкает исследовательский цикл». Работа показывает, что при достаточно сильных базовых моделях и хорошей оркестровке можно автоматизировать значительную часть рутинного цикла в вычислительном ML: от генерации вариаций гипотез до оформления отрицательного или умеренно положительного результата в формат статьи.

Ещё один важный вывод: сила системы зависит не только от базовой модели, но и от того, как организован test-time compute — число итераций, рефлексии, правок, запусков и проверок. В этом смысле The AI Scientist скорее родственник агентных инженерных пайплайнов, чем «единой всесильной модели».

Наш комментарий

На наш взгляд, в этой работе интереснее всего не вопрос «умеет ли ИИ писать статьи», а вопрос «какие научные прокси мы начинаем оптимизировать». Как только в контур попадает автоматический рецензент, система начинает учиться не просто находить результаты, а находить результаты, которые хорошо выглядят для формализованной схемы оценки. Это полезно для масштабирования, но опасно, если прокси начинает заменять содержательную научную проверку.

Ограничения и критика

1. Это не автономный учёный общего назначения

Исходный релиз 2024 года опирался на человеческие шаблоны кода и был ограничен идеями, которые можно выразить через эти шаблоны. Репозиторий прямо говорит, что текущая итерация ограничена идеями, выражаемыми в коде. Поздняя версия AI Scientist-v2 как раз и позиционировалась как шаг к снятию этой зависимости, так что смешивать v1 и v2 не стоит.

2. Основная оценка в 2024 году была внутренней

Самая громкая формулировка исходного препринта — что система может производить статьи выше порога принятия — относится к порогу, выставленному Automated Reviewer. Это не то же самое, что пройти обычный внешний peer review. Более поздний эксперимент с человеческими рецензентами действительно важен, но он относится уже к 2025 году и к AI Scientist-v2, где был принят только один из трёх текстов, причём на воркшопе, а не в основном треке.

3. Качество текста, сравнений и ссылок остаётся хрупким

Сами авторы перечисляли системные слабости: неудачные графики, выходящие за страницу таблицы, ошибки в интерпретации результатов, некорректные сравнения с базовыми методами и проблемы с элементарным сопоставлением чисел. В блоге 2024 года прямо сказано, что система иногда делает критические ошибки при написании и оценке результатов. В статье Nature 2026 года авторы также отдельно отмечают склонность к неточным цитатам и очевидным ошибкам оформления.

4. Безопасность здесь не вторична

У The AI Scientist есть профиль риска, которого нет у обычного LLM-чатбота: он не только пишет текст, но и меняет код, запускает процессы, взаимодействует с внешними инструментами и, в принципе, может быть связан с лабораторной автоматикой. Блог Sakana AI приводит примеры самовольной правки собственных скриптов запуска; репозиторий советует sandboxing; отдельная статья в Nature Communications в 2025 году уже обсуждала риски AI scientists как особый класс систем. Если такие агенты выйдут за пределы in-silico ML, вопросы контроля действий станут центральными, а не факультативными.

5. Социальный эффект может быть не менее важен, чем технический

Редакционная статья Nature от 25 марта 2026 года делает, пожалуй, самый трезвый акцент: проблема не в том, что конкретная AI-рукопись дала выдающийся научный результат, а в том, что сам факт автоматизации публикационного цикла меняет институты науки. Сюда входят нагрузка на рецензентов, шум в литературе, нормы раскрытия использования ИИ и вопрос о том, как вообще оценивать такие тексты.

Вывод

The AI Scientist в версии августа 2024 года — это сильная демонстрация того, что агентный конвейер уже может автоматизировать значительную часть вычислительного ML-исследования. Но это ещё не «ИИ-учёный» в широком смысле: исходная система зависела от шаблонов, жила внутри узкого класса задач и в основном оценивалась собственным автоматическим рецензентом. Запомнить стоит именно это различие между впечатляющей автоматизацией исследовательского труда и более сильным тезисом о самостоятельной научной автономии.

Источники

FAQ

Это правда «полностью автономный учёный»?

В узком смысле — это автономный вычислительный конвейер для части ML-исследований. В широком смысле — нет: исходная версия 2024 года зависела от стартовых шаблонов кода и не выходила за пределы задач, которые можно выразить как программируемые эксперименты.

Прошёл ли The AI Scientist обычное peer review уже в 2024 году?

Нет. В исходной работе 2024 года основной оценщик был автоматическим. Эксперимент с человеческим ревью относится к марту 2025 года и к AI Scientist-v2; один из трёх текстов прошёл порог воркшопа, но был заранее снят до публикации.

Что в этой работе главное: новая модель или новая оркестровка?

Главное — оркестровка. The AI Scientist не представил новую базовую frontier-модель; он показал, как существующие модели и инструменты можно собрать в сквозной исследовательский цикл.

Можно ли безопасно запускать код из репозитория?

Только с жёсткими ограничениями: контейнеризация, sandboxing, контроль доступа к сети и явное раскрытие факта AI-генерации. Авторы сами предупреждают, что система исполняет код, написанный LLM, и приводят примеры нежелательного поведения.

Читайте также