Запись архива

GenCast и GraphCast: как ИИ обошёл эталонные метеомодели ECMWF

Разбираем две ключевые погодные работы DeepMind — GraphCast и GenCast. Где ML действительно обошёл ECMWF, почему сравнение с HRES и ENS — не одно и то же, и что это меняет для практиков.

Схема сравнения GraphCast и GenCast: детерминированный графовый прогноз на 10 суток и вероятностный диффузионный ансамбль на 15 суток для глобальной атмосферы

В 2023 году DeepMind показала GraphCast — детерминированную графовую модель, которая в статье для Science обошла ECMWF HRES в среднесрочном глобальном прогнозе. 4 декабря 2024 года компания опубликовала в Nature работу о GenCast: это уже вероятностная ансамблевая модель, сравниваемая не с детерминированным HRES, а с более сильным operational baseline ENS.

Это различие принципиально. GraphCast показывает, что ML может делать очень точный один лучший прогноз, а GenCast — что ML может конкурировать и там, где метеослужбам нужна не одна траектория, а распределение рисков. Ниже — разбор именно этих двух работ; более позднюю линию WeatherNext мы упоминаем только как текущий репозиторий кода, но не смешиваем с результатами статей.

Коротко

  • GraphCast — детерминированная модель на графах для глобального прогноза до 10 суток; в официальных summary она обходит HRES на большой части проверочных целей и делает прогноз меньше чем за минуту.
  • GenCast — вероятностная диффузионная модель для ансамблевого прогноза до 15 суток при разрешении 0,25°; в статье Nature она лучше ENS на 97,2% из 1320 проверенных целей и генерирует один 15-дневный прогноз примерно за 8 минут.
  • Главный сдвиг между работами — не только в точности, а в переходе от одной траектории к распределению возможных сценариев. Для энергетики, циклонов и экстремальной погоды это важнее, чем просто улучшить среднюю ошибку.
  • Обе системы не отменяют классическую метеорологию: они обучаются на ERA5 и зависят от традиционных анализов и инициализации. Даже официальный открытый код сопровождается оговоркой, что он не заменяет официальные предупреждения метеослужб.

Контекст

Классический численный прогноз погоды строится на физических уравнениях атмосферы и очень дорогих вычислениях. Но для практики важны два разных режима работы. HRES — это детерминированный прогноз: система выдаёт одну наиболее вероятную траекторию. ENS — ансамблевый прогноз: система выдаёт множество траекторий и тем самым оценивает неопределённость.

Именно поэтому победы GraphCast и GenCast нельзя читать как одну и ту же историю. GraphCast сравнивали с HRES, то есть с сильной, но всё же одиночной траекторией. GenCast сравнивали уже с ENS, а в самой статье Nature ансамбли прямо описываются как рабочий стандарт там, где решения зависят от риска, а не только от среднего значения.

К моменту выхода GenCast у ML-прогнозов была известная слабость: они часто хорошо минимизировали среднеквадратичную ошибку, но выдавали размытые поля и плохо представляли неопределённость. Авторы GenCast прямо пишут, что ранние ML-подходы в основном были детерминированными, а независимый контекст из статьи про NeuralGCM показывает ту же проблему с другой стороны: чисто ML-модели могут быть заметно более «мыльными», чем физические прогнозы, особенно на длинных горизонтах.

Метод

GraphCast

GraphCast — это графовая нейросеть для глобального прогноза погоды. По официальному описанию DeepMind, модель берёт два состояния атмосферы с шагом 6 часов, предсказывает следующее состояние через 6 часов, а затем разворачивает прогноз авторегрессионно до 10 суток вперёд. Простыми словами: модель не решает уравнения атмосферы в явном виде, а учится по историческим данным тому, как глобальное поле погоды эволюционирует во времени.

Ключевая инженерная идея — представить Землю не только как обычную широтно-долготную сетку, но и как многоуровневую графовую структуру, где удобно передавать информацию между соседними регионами и масштабами. В этом смысле название GraphCast не маркетинговое: граф здесь — центральная часть архитектуры, а не декоративная деталь.

Для обучения использовали несколько десятилетий реанализа ERA5 от ECMWF. Это тоже важный нюанс: модель выглядит как альтернатива классическому NWP, но фактически стоит на его плечах, потому что реанализ сам по себе строится с участием традиционной физической метеорологии и ассимиляции наблюдений.

GenCast

GenCast наследует пространственную логику семейства GraphCast, но меняет цель. Вместо одной лучшей траектории модель учится описывать условное распределение будущих состояний атмосферы P(X(t+1)|X(t), X(t-1)). Технически это реализовано как conditional diffusion model: на каждом шаге будущая карта погоды начинается с шума и затем итеративно «очищается» нейросетью, которая видит два предыдущих состояния атмосферы.

Из-за того, что каждый шаг стартует из нового случайного шума, процесс можно повторять много раз и получать ансамбль возможных траекторий. В статье и оценке GenCast сопоставляют свои ансамбли с ENS; для сравнения использовали 50-членные ансамбли, чтобы протокол соответствовал operational baseline.

Если использовать упрощённую аналогию, GraphCast рисует одну лучшую карту будущего, а GenCast снимает серию правдоподобных фильмов о будущем и даёт оценку того, насколько они согласованы между собой. Для пользователя это значит переход от ответа «что, скорее всего, случится» к ответу «какие сценарии возможны и насколько они вероятны».

Результаты

Самая полезная рамка для чтения результатов такая: GraphCast — это прорыв в детерминированном режиме, GenCast — в вероятностном. Сравнивать их по одной строке «кто точнее» некорректно, потому что у них разные цели и разные baseline.

Модель Тип прогноза Горизонт Разрешение С чем сравнивали Ключевой результат Скорость
GraphCast Детерминированный До 10 суток 0,25° ECMWF HRES В официальных summary DeepMind и Science результат подаётся как преимущество над HRES на более чем 90% из 1380 verification targets; на странице публикации DeepMind есть более гранулярная формулировка: 89,3% из 2760 combinations variable/lead time. Менее 1 минуты на 10-дневный прогноз
GenCast Вероятностный ансамбль До 15 суток 0,25° ECMWF ENS Лучше ENS на 97,2% из 1320 целей в статье Nature; авторы также заявляют преимущество на экстремальной погоде, треках тропических циклонов и в задаче прогноза выработки ветропарков Около 8 минут на один 15-дневный прогноз

Для GenCast особенно важны не только headline-цифры, но и тип задач, где модель показывает смысл ансамбля. В статье отдельно разбираются экстремальные температуры, сильные ветры, тропические циклоны и агрегированный прогноз ветрогенерации. Это уже не просто соревнование по RMSE: речь идёт о том, насколько система умеет поддерживать решения в условиях неопределённости.

Ещё один заметный результат — скорость. Обе линии DeepMind радикально сокращают стоимость inference по сравнению с классическим глобальным NWP. Это не означает, что вся метеосистема внезапно становится дешёвой, но означает, что вычислительный бюджет можно перераспределять: например, чаще пересчитывать сценарии, быстрее обновлять downstream-модели или использовать ML-прогнозы как дополнительный слой в операционном конвейере.

Интерпретация

Наш комментарий

На наш взгляд, главная новость тут не в формуле «ИИ лучше прогнозирует погоду». Более точная формулировка такая: сначала DeepMind показала, что данные и графовая архитектура позволяют обойти сильную детерминированную модель; затем — что генеративный, вероятностный ML может конкурировать уже с ансамблевым operational standard.

Для практиков это важнее любой красивой цифры. Энергетика, гражданская защита, морская логистика и страхование работают не с одной картой будущего, а с диапазоном сценариев и стоимостью ошибки. В этой логике GenCast выглядит более операционно значимым шагом, чем GraphCast, даже если именно GraphCast в 2023 году дал самый яркий символический сигнал рынку.

Есть и второй важный вывод. DeepMind не отказалась от графовой пространственной индукции, когда перешла к генеративной модели: наоборот, она встроила вероятностную генерацию поверх той же идеи структурированного представления глобальной атмосферы. Для инженеров это хороший сигнал: переход к генеративности не отменяет сильных inductive bias, а часто опирается на них.

Ограничения и критика

  • Это не победа над всей метеорологией. GraphCast и GenCast сравниваются с конкретными системами ECMWF и в конкретных режимах. GenCast в официальном блоге прямо описан как модель, которой всё ещё нужны training data и initial conditions из традиционной метеорологии, а текущий официальный репозиторий предупреждает, что такие модели не заменяют официальные alerts и warnings.
  • Ретроспективная оценка важна не меньше headline-результата. Для GenCast DeepMind отдельно указывает, что модель обучали на исторических данных до 2018 года и тестировали на 2019-м. Это сильный и аккуратный протокол, но всё же не то же самое, что бесшовная многолетняя operational эксплуатация в реальном контуре.
  • В официальных summary есть числовые расхождения. Для GenCast блог говорит о 99,8% целей при lead time больше 36 часов, тогда как peer-reviewed статья Nature пишет 99,6%. Для GraphCast в официальных материалах встречаются формулировки и про более чем 90% из 1380 targets, и про 89,3% из 2760 combinations. Это не отменяет общий вывод о преимуществе моделей, но показывает, что practitioner должен смотреть не только на headline, а на denominator и protocol.
  • Проблема физической согласованности не исчезла. Статья про NeuralGCM прямо показывает, что чисто ML-модели, включая GraphCast, могут быть более размытыми и хуже вести себя по спектрам на длинных горизонтах, чем физические прогнозы. GenCast во многом и является ответом на эту критику: он пытается генерировать резкие, реалистичные individual trajectories, а не только хороший средний прогноз.
  • Историческую область нужно отделять от текущего состояния кода. Сегодня официальный код старых моделей живёт в репозитории WeatherNext, но это не означает, что результаты статей GraphCast и GenCast автоматически переносятся на более поздние checkpoints и operational descendants. В этом разборе мы сознательно фиксируем scope на статьи 2023–2024 годов.

Вывод

GraphCast доказал, что графовая ML-модель может обойти один из главных детерминированных стандартов среднесрочного прогноза погоды. GenCast сделал следующий, более трудный шаг: показал, что вероятностная генеративная модель может конкурировать уже с ансамблевым стандартом ECMWF ENS.

Практический вывод для инженера простой: будущее здесь не в лозунге «физику заменили нейросетью», а в том, что прогноз погоды становится быстрее, вероятностнее и сильнее завязан на гибридные pipelines, где ML и классическая метеорология работают вместе.

Источники

FAQ

GraphCast и GenCast — это одна и та же модель?

Нет. GraphCast — детерминированная модель для одной лучшей траектории прогноза, а GenCast — вероятностная ансамблевая модель, построенная позже и решающая другую задачу. В текущем официальном репозитории они лежат рядом, но статьи и протоколы сравнения у них разные.

Почему сравнение с ENS важнее, чем с HRES?

Потому что ENS — это уже ансамблевый operational forecast, который нужен там, где важна неопределённость и риск. Победить HRES — значит сделать очень хороший одиночный прогноз. Победить ENS — значит показать конкурентоспособность в более практическом probabilistic setting.

Заменят ли такие модели синоптиков и классические суперкомпьютерные системы?

По материалам самих DeepMind — нет. Традиционные модели остаются источником реанализа, инициализации и operational инфраструктуры, а открытый репозиторий отдельно предупреждает, что модели не заменяют официальные предупреждения метеослужб.

Можно ли использовать эти модели в своих экспериментах?

Да, код и веса опубликованы официально. Но paper-level результаты получались на специализированном железе и в строгих evaluation protocols, поэтому воспроизведение headline-метрик в локальной демонстрации и их перенос в production — это разные задачи.

Читайте также