GNoME: что реально означает «2,2 млн новых материалов» в работе DeepMind

Разбираем GNoME от Google DeepMind по первоисточникам: что в работе значит 2,2 млн «новых материалов», почему ключевая цифра — 381 тыс. стабильных кристаллов, и где проходят границы этих выводов.

Схема конвейера GNoME: генерация структурных и композиционных кандидатов, фильтрация графовыми сетями, DFT-проверка и формирование обновлённой convex hull

GNoME (Graph Networks for Materials Exploration) — система Google DeepMind для поиска неорганических кристаллов, описанная в статье Nature, опубликованной 29 ноября 2023 года. Несмотря на подсказку «Nature 2024», исторически ключевой первоисточник именно 2023 года; в 2024-м вокруг работы вышли критические комментарии, а не новая базовая статья. Главная практическая новость работы не в лозунге про «2,2 млн новых материалов», а в том, что после пересчёта и обновления convex hull авторы оставили 381 тыс. новых стабильных записей и открыли данные для дальнейшего скрининга.

Для разработчиков, вычислительных химиков и ML-инженеров здесь важна одна развилка: GNoME не «изобрёл готовые вещества для производства», а резко расширил и ускорил поиск кандидатов, которые потом нужно перепроверять более точными расчётами и экспериментом. Именно в таком режиме эту работу и полезно читать.

Коротко

  • Ключевая статья про GNoME вышла 29 ноября 2023 года в Nature; это важно, потому что часть обсуждений 2024 года — уже критика и уточнение масштаба заявлений.
  • Число 2,2 млн относится к структурам, которые выглядят стабильными относительно прежних каталогов. Финальное число новых записей на обновлённой convex hull в статье — 381 тыс.; в блоге DeepMind это число округлено до 380 тыс.
  • Основной методический вклад — активный цикл «генерация кандидатов → графовая сеть → DFT-проверка → дообучение», а не просто большой датасет на выходе.
  • Работа даёт полезный каталог для последующего screening, но не доказывает автоматически синтезируемость, промышленную полезность или истинную новизну каждого кандидата.
  • Критика сосредоточена на слове «новый», на проблемах порядка/беспорядка и на том, что устойчивость при 0 K в DFT — это не то же самое, что экспериментальная реализуемость.

Контекст: что именно заявляет GNoME

Задача, которую решают авторы, старая и очень приземлённая: пространство возможных неорганических кристаллов слишком велико, а прямой перебор через плотностно-функциональную теорию (DFT) слишком дорог. По данным статьи Nature и официального блога DeepMind, до GNoME вычислительные каталоги давали около 48 тыс. стабильных кристаллов, а после обновлённой convex hull суммарный каталог вырос до 421 тыс.

Но уже здесь нужен перевод с PR-языка на технический. В статье речь идёт не о «материалах» в максимально широком бытовом смысле, а об упорядоченных неорганических кристаллических структурах. Это важное уточнение позже отдельно поднимают и критики работы в Chemistry of Materials.

Ключевой термин статьи — stability with respect to the convex hull. Упрощённо: для данного состава структура считается стабильной, если не существует более выгодной по энергии смеси конкурентных фаз. Это хорошая физическая эвристика для первичного отсечения кандидатов, но она не эквивалентна ни полезности, ни лёгкости синтеза, ни устойчивости при комнатной температуре.

Ещё один важный исторический штрих: по данным самой статьи, основные поисковые запуски опирались на снимки Materials Project от марта 2021 года и OQMD от июня 2021 года, а сравнительный пересчёт с «внешним миром» авторы делали на снимке июля 2023 года. Для практиков это значит, что GNoME нужно читать как работу о конкретном зафиксированном состоянии каталогов, а не как вечную истину про «все возможные материалы».

Метод: как работает GNoME

Метод состоит из двух поисковых контуров. Первый — структурный: система берёт известные кристаллы и порождает новые кандидаты модификацией уже существующих структур. Здесь авторы вводят SAPS — symmetry aware partial substitutions, то есть частичные замещения с учётом симметрии. Практический смысл простой: модель умеет не только «заменить весь подрешёток целиком», но и менять лишь часть кристаллографически эквивалентных позиций, открывая более сложные упорядоченные варианты.

Второй контур — композиционный. Он стартует не со структуры, а с химической формулы и затем, по данным статьи, инициализирует случайные структуры через AIRSS. Для каждой перспективной композиции авторы прогоняют множество стартовых вариантов и уже потом отправляют лучшие кандидаты в дорогую DFT-релаксацию.

В обоих контурах графовые нейронные сети предсказывают полную энергию кристалла. Чтобы снизить хрупкость на неотрелаксированных структурах, авторы, по данным статьи, используют масштабирование объёма решётки на этапе inference и ансамбли моделей с оценкой неопределённости. После этого идёт главное: не ML «вместо физики», а ML как фильтр перед физикой. Перспективные структуры проверяются DFT в VASP, и эти результаты возвращаются в обучающий набор следующего раунда.

Именно этот цикл авторы называют data flywheel. По внутренним метрикам статьи, начальные hit rate были низкими, а после шести раундов active learning структурный контур поднялся выше 80% hit rate, композиционный — выше 33%, а ошибка предсказания на relaxed structures снизилась до 11 meV/atom. Для читателя важнее не сами цифры, а форма решения: модель не разово ранжирует фиксированный список, а постепенно учится на собственных физически проверенных ошибках.

Почему 2,2 млн — не финальное число

Здесь находится главная ловушка всех пересказов. По статье Nature и блогу DeepMind, GNoME нашла более 2,2 млн структур, стабильных относительно прежних каталогов. Но когда эти структуры начинают конкурировать уже друг с другом и вместе образуют новую convex hull, финальным каталогом новых stable entries становятся 381 тыс. записей.

Именно поэтому число 2,2 млн не стоит читать как «2,2 млн готовых новых материалов». Это скорее верхний слой кандидатов до окончательного внутреннего отбора. Для downstream-задач — от поиска твёрдых электролитов до построения новых property predictors — опираться разумнее на updated hull, а не на всю сырую массу первоначальных находок.

Результаты

Показатель До GNoME / сравнение Что сообщает работа Как это читать
Стабильные вычислительные кристаллы в предыдущих каталогах Около 48 тыс. Итоговый каталог после обновлённой convex hull — 421 тыс. Это масштаб расширения поискового пространства, а не число экспериментально проверенных веществ.
Структуры ниже старой convex hull — Более 2,2 млн Промежуточный пул кандидатов до внутренней конкуренции между самими открытиями.
Новые записи на updated convex hull — 381 тыс. в статье; 380 тыс. в блоге как округление Главная итоговая цифра работы для практического screening.
Независимые совпадения с экспериментальными структурами ICSD — 736 Это не новые синтезы DeepMind, а совпадения с независимо полученными экспериментальными структурами.
Проверка более точным functional r2SCAN — 84% бинарных и тернарных структур сохраняют отрицательную phase-separation energy; для четверных авторы сообщают 86,8% Полезная, но не абсолютная sanity-check-проверка против зависимости от выбранного functional.

Примечание: расхождение 380 тыс. против 381 тыс. — не конфликт источников, а округление в официальном блоге DeepMind относительно более точного числа в статье Nature.

Отдельно стоит отметить валидацию. По статье и supplementary materials, 736 структур совпали с экспериментальными структурами, появившимися независимо в литературе и агрегированных через ICSD. Это хороший знак, но трактовать его надо аккуратно: совпадение с опубликованной структурой подтверждает, что модель не бредит на пустом месте, однако не превращает все остальные сотни тысяч записей в автоматически синтезируемые вещества.

Ещё один сильный результат — проверка на более точном functional r2SCAN. В основной статье и supplementary authors report, что 84% найденных бинарных и тернарных кристаллов сохраняют отрицательную phase-separation energy, а для четверных структур приводится 86,8%. Для материаловедов это важно, потому что PBE может ошибаться около границы convex hull; авторы хотя бы частично проверяют, что каталог не разваливается при переходе к более строгой схеме.

Наконец, у работы есть и прикладочный хвост. По данным самой статьи, тот же каталог даёт около 52 тыс. стабильных слоистых материалов и 528 перспективных Li-ion conductors по заранее заданным screening-эвристикам. Эти числа полезны как демонстрация масштаба поиска, но их лучше понимать именно как результат внутреннего скрининга авторов, а не как готовый список веществ для немедленного внедрения.

Интерпретация

Для практиков GNoME важна в трёх плоскостях. Первая — алгоритмическая: работа показывает, что search в кристаллическом пространстве можно масштабировать не только грубой генерацией кандидатов, но и активным контуром, где нейросеть направляет дорогой физический вычислитель. Вторая — инфраструктурная: результатом становится не только paper, но и открываемый каталог структур, код и dataset DOI, на которых можно строить последующие фильтры, классификаторы и инструменты дедупликации. Третья — научно-методическая: paper аккуратно переводит разговор об «AI for science» из плоскости демо в плоскость воспроизводимой поисковой системы.

Это особенно заметно по тому, что вторая половина статьи посвящена уже не только поиску стабильных кристаллов, но и побочному продукту в виде большого корпуса DFT-релаксаций для обучения interatomic potentials. То есть GNoME полезна не просто как каталог кандидатов, а как способ накопить физически осмысленные данные для следующих моделей.

Наш комментарий

На наш взгляд, реальный вклад GNoME — не в риторике про «миллионы новых материалов», а в операционализации цикла материаловедческого поиска. Работа соединяет эвристическую генерацию, графовые сети, DFT-арбитраж и открытый релиз данных в одну систему. В этом смысле GNoME ближе к высокоотзывчивому поисковику по пространству кристаллов, чем к окончательному оракулу синтезируемости.

Это сильная позиция. Поисковику не нужно быть безошибочным в каждой отдельной точке пространства; ему нужно резко повышать полезный выход дорогих вычислений и экспериментов. Если смотреть на paper именно так, её масштаб уже не кажется маркетинговой гиперболой, а становится понятной инженерной ставкой: сначала расширяем воронку кандидатов, потом всё жёстче фильтруем их физикой и лабораторией.

Ограничения и критика

  • Стабильность в DFT не равна синтезируемости. Базовая метрика здесь — термодинамическая устойчивость относительно convex hull при 0 K. Она ничего автоматически не гарантирует про кинетику, фазовые переходы, дефекты, беспорядок, технологичность синтеза и полезные свойства.
  • Каталог по определению временный. Авторы сами пишут, что будущие открытия могут вытеснить часть нынешних записей с convex hull; в supplementary отдельно обсуждается, что более глубокий поиск внутри выбранных химических систем действительно смещает часть структур. То есть updated hull — это сильный рабочий baseline, но не финальная «карта истины».
  • Проблема новизны сложнее, чем проблема энергии. В критической перспективе Cheetham и Seshadri указывают, что часть записей может быть тривиальными упорядоченными вариантами известных структур, а также что paper игнорирует многие эффекты беспорядка и конечной температуры. Эта критика не обнуляет идею GNoME, но заставляет аккуратнее использовать слова «новый» и «материал».
  • 736 совпадений с ICSD — это не 736 новых синтезов авторов. Это независимые экспериментальные совпадения из литературы. Экспериментальная ветка с реальным автосинтезом описана в отдельной companion-работе A-Lab, опубликованной в тот же день в Nature.
  • С companion-экспериментом тоже не всё однозначно. Исходная статья A-Lab сообщала, по данным самой публикации, о 36 из 57 реализованных целей за 17 дней, но позже к ней вышла author correction, а в Nature News и последующих обсуждениях поднимались вопросы к идентификации и новизне. Это важно, потому что experimental corroboration вокруг GNoME нельзя трактовать как безусловно закрытый вопрос.
  • Нужно фиксировать дату и версию данных. Paper опирается на конкретные снимки Materials Project и OQMD. Для практической работы с каталогом это означает: всегда указывайте, какой именно snapshot, какой functional и какая версия внешней базы использовались в вашем pipeline.

Заключение

Если запомнить из GNoME только одну вещь, то вот она: 2,2 млн — это не число «готовых новых материалов», а размер крупного пула кандидатов до финальной внутренней конкуренции. Практически значимая цифра статьи — 381 тыс. новых стабильных записей на обновлённой convex hull и суммарный каталог в 421 тыс. стабильных кристаллов.

Работа DeepMind важна потому, что превращает поиск кристаллов в масштабируемый контур «ML плюс физическая верификация». Но её нельзя читать как доказательство того, что проблема материаловедческого открытия уже решена: вопросы синтеза, новизны, disorder, finite-temperature physics и полезных свойств остаются за пределами одного paper.

Источники

FAQ

GNoME правда открыла 2,2 млн новых материалов?

Не в том смысле, как это читается в заголовке. Число 2,2 млн относится к структурам-кандидатам, стабильным относительно прежних каталогов; финальное число новых stable entries на обновлённой convex hull в статье — 381 тыс.

Почему в одних источниках 380 тыс., а в других 381 тыс.?

381 тыс. — число из статьи Nature. 380 тыс. — округление в официальном блоге DeepMind. Для точного технического пересказа лучше использовать 381 тыс. и отдельно пояснять, откуда берётся округление.

Доказывает ли GNoME, что эти вещества можно легко синтезировать?

Нет. Работа показывает термодинамическую правдоподобность и полезность ML-фильтрации перед DFT и экспериментом. Реальный синтез зависит от кинетики, условий процесса, disorder, метастабильности и множества факторов вне основной метрики paper.

Что практику делать с GNoME сегодня?

Лучше всего воспринимать GNoME как генератор и ранжировщик кандидатов для собственного screening-pipeline: дедупликация, повторная DFT-проверка, property filters, проверка на конечные температуры и, если нужно, экспериментальный follow-up. Не как закрытую базу «готовых открытий».

Читайте также