Запись архива

ESM3 и esmGFP: как EvolutionaryScale сгенерировала новый флуоресцентный белок

Разбираем работу ESM3 об esmGFP без медийной формулы про «500 миллионов лет эволюции»: что именно задали модели, как шёл отбор кандидатов и что реально доказал лабораторный эксперимент.

Схема двухэтапной генерации esmGFP: частичный GFP-промпт, поиск слабого дальнего кандидата B8 и доработка до яркого варианта C10/esmGFP

25 июня 2024 года EvolutionaryScale анонсировала ESM3 и показала esmGFP — искусственный флуоресцентный белок, найденный моделью и затем проверенный в лаборатории. Исторически это работа 2024 года, но точнее разбирать её по рецензируемой статье Simulating 500 million years of evolution with a language model, которая вышла в Science 21 февраля 2025 года после электронной публикации 16 января 2025 года.

Главное здесь не только то, что белок светится. Важнее другое: авторы показали связку мультимодального белкового языкового моделирования, структурных ограничений, ранжирования кандидатов и мокролабораторной валидации — и именно эта связка делает результат интересным для практиков.

Коротко

  • esmGFP не был получен из полностью пустого запроса: авторы зафиксировали несколько ключевых остатков, нужных для образования хромофора, и часть структуры природного GFP.
  • ESM3 — это генеративная мультимодальная модель по белкам, работающая сразу с последовательностью, структурой и функцией, а не только с аминокислотной строкой.
  • В первом раунде лабораторной проверки статья описывает 88 дизайнов на 96-луночной пластине; публичный анонс в июне 2024 года говорил о 96 генерациях. Это небольшой, но показательный пример того, почему стоит читать саму работу, а не только пресс-релиз.
  • Финальный esmGFP имеет 58% идентичности последовательности к ближайшему известному флуоресцентному белку; авторы оценивают такую удалённость как эквивалент более чем 500 миллионам лет естественной дивергенции.
  • Работа убедительно показывает один узкий, но реальный кейс de novo-дизайна с мокрой проверкой. Она не доказывает, что ESM3 уже умеет надёжно проектировать произвольные функциональные белки «по текстовому запросу».

Контекст

Выбор GFP как демонстрационной задачи был не случайным. Флуоресценцию сравнительно удобно измерять экспериментально, но сам механизм её возникновения очень требователен к геометрии белка: нужно не просто угадать набор аминокислот, а собрать такую локальную и глобальную структуру, при которой внутри белка сформируется и заработает хромофор.

Для практического белкового дизайна это хороший стресс-тест. Если модель может удержать несколько критических позиций, достроить вокруг них правдоподобный каркас и вывести конструкцию в работающий режим, это уже сильнее обычного сценария «предсказать структуру известной последовательности».

Важно и то, что публичная формула «сгенерированный с нуля белок» здесь требует уточнения. Корректнее говорить о сильно ограниченном de novo-дизайне внутри семейства GFP-подобных белков: авторы не просили модель из пустоты изобрести любую флуоресценцию, а задали ей биологически значимые опоры.

Метод

Что такое ESM3

ESM3 авторы описывают как генеративную модель, которая совместно оперирует тремя модальностями: последовательностью, структурой и функцией белка. На уровне обучения это выглядит как masked language modeling для нескольких «дорожек» токенов: часть последовательности, структуры и функциональных меток маскируется, а модель восстанавливает пропуски, учась связывать эти представления друг с другом.

По данным препринта и официального анонса, семейство ESM3 обучалось в нескольких масштабах, а крупнейшая версия имела 98 миллиардов параметров и обучалась на 2,78 миллиарда белков. Отдельно был выпущен открытый ESM3-open на 1,4 миллиарда параметров, но это не тот же самый режим, что headline-демонстрация с esmGFP.

Как именно генерировали esmGFP

Судя по методическому приложению препринта, GFP-кейс строился не как «сгенерируй мне светящийся белок», а как жёстко направляемая процедура. Авторы задавали почти полностью замаскированный белок длиной 229 остатков, но фиксировали ключевые позиции, связанные с образованием хромофора, и часть центральной спирали из природного GFP-шаблона 1QY3.

Дальше шёл многошаговый pipeline:

  1. сначала модель генерировала структуру, по сути — каркас будущего белка;
  2. затем кандидаты фильтровались по геометрии активного участка и по тому, насколько они достаточно отличаются от исходного шаблона;
  3. после этого модель генерировала аминокислотную последовательность под найденную структуру;
  4. потом выполнялась совместная оптимизация последовательности и структуры;
  5. на выходе кандидаты ранжировались по набору прокси-метрик, включая структурную правдоподобность и языковые оценки;
  6. лучшая подвыборка синтезировалась и тестировалась в E. coli.

Технически это важный момент: ESM3 здесь выступает не одиночным «оракулом», а ядром многоступенчатого цикла генерации, фильтрации и отбора. Для практиков это ближе к реальному design workflow, чем к красивому одиночному демо.

Ещё одно существенное уточнение: судя по приложению препринта, конкретно GFP-дизайны создавались базовой 7B-версией ESM3 без финетюна. В публичных пересказах этот нюанс часто теряется на фоне общей истории про 98B-модель и масштабирование семейства.

Результаты

Основная экспериментальная история состояла из двух раундов. В первом раунде авторы искали дальние от известных GFP кандидаты, которые хотя бы показывают сигнал. Во втором — брали самый интересный «тусклый, но дальний» хит и дорабатывали его дальнейшей генерацией.

Этап Что показали авторы Что это означает
Публичный анонс и статья Анонс 25 июня 2024 года говорил о 96 протестированных генерациях; в основном тексте статьи говорится о 88 дизайнах на 96-луночной пластине. Для точного разбора лучше опираться на статью и приложение, а пресс-релиз использовать как исторический контекст.
Раунд 1 Авторы нашли дизайн B8: в статье он описан как далёкий от известных флуоресцентных белков, с измеримым сигналом, но примерно в 50 раз менее яркий, чем природные GFP, и с созреванием хромофора в течение недели. B8 был не «готовым успехом», а доказательством, что модель может выйти в рабочую, хотя и слабую, область пространства последовательностей.
Раунд 2 Продолжая генерацию от B8, авторы собрали вторую 96-луночную пластину и нашли несколько более ярких вариантов; лучший кандидат в лунке C10 получил имя esmGFP. Ключевой результат не в одном случайном попадании, а в том, что слабый дальний хит удалось дорастить до яркого варианта.
Итоговый esmGFP esmGFP имеет 58% идентичности к ближайшему известному флуоресцентному белку. Авторы оценивают такую удалённость как эквивалент более чем 500 миллионов лет естественной эволюционной дивергенции. Это главный headline работы, но оценку «500 миллионов лет» нужно читать как модельную эволюционную аппроксимацию, а не как буквальную симуляцию времени.
Спектральные свойства Точные пики авторы приводят в статье: для esmGFP указаны 496 нм для возбуждения и 512 нм для эмиссии. Эта деталь полезна практикам, но в доступных официальных анонсах она почти не обсуждалась; для неё стоит опираться именно на статью.

Отдельно стоит отметить лабораторную верификацию. Это не purely in silico-результат: кандидаты экспрессировались в E. coli, измерялись на пластине и дополнительно анализировались по спектрам. Для разговора о генеративной биологии это критично, потому что без мокрой проверки история оставалась бы просто красивым вычислительным кейсом.

Интерпретация

Что здесь действительно нового

Самая содержательная часть работы — не медийная формула про «полмиллиарда лет эволюции», а демонстрация того, что мультимодальная белковая модель можно направлять локальными структурными ограничениями и выводить к работающему белку в сильно удалённой области known protein space. Это уже не просто sequence-only мутационный поиск и не просто предсказание структуры.

Практически важно и то, что авторы совмещают несколько уровней представления: локальную химию активного центра, глобальный каркас, функцию и языковые priors по эволюционным данным. Для белкового дизайна это более правдоподобная постановка, чем попытка выбирать последовательности только по одному скору.

Наш комментарий

На наш взгляд, работу лучше читать как демонстрацию управляемого поиска, а не как доказательство того, что модель «сама придумала новый белок». Человеческий вклад здесь большой: выбрана семейство GFP, заданы критические остатки, выбран шаблонный участок, настроен pipeline фильтрации, а финальный критерий успешности — обычная лабораторная проверка.

Но это не делает результат слабым. Скорее наоборот: именно такая постановка ближе к тому, как ИИ-инструменты реально будут использоваться в белковой инженерии — не вместо биолога, а как генератор и ранжировщик кандидатов под заранее заданные биофизические ограничения.

Ограничения и критика

Первое: формула «с нуля» здесь неточна. По статье модель не стартовала из полностью пустого пространства: ей задали ключевые остатки хромофора и кусок структуры природного GFP. Это всё ещё впечатляющий de novo-дизайн, но не unconstrained generation.

Второе: оценка «более 500 миллионов лет эволюции» — это не наблюдаемая история белка и не буквальная симуляция дарвиновского процесса. В приложении авторы строят регрессионную оценку времени дивергенции из соотношения между sequence identity и филогенетическими расстояниями у выбранных GFP-линий. То есть это полезная, но модельно-зависимая интерпретация.

Третье: работа показывает один showcase-кейс на одном семействе белков. Из неё нельзя прямо вывести, что та же схема столь же надёжно перенесётся на ферменты, мембранные белки или белки с более сложной функциональной геометрией.

Четвёртое: headline-результат не стоит автоматически переносить на открытый ESM3-open. Открытая версия — это 1,4B-модель, тогда как связку именно с 7B-режимом генерации GFP мы видим в приложении препринта; в любом случае paper не показывает, что esmGFP воспроизводится открытыми весами «из коробки».

Пятое: между публичными материалами и статьёй есть мелкие расхождения в формулировках и подсчётах. Для исследовательской журналистики это не катастрофа, но для практиков это напоминание: пресс-релиз и рецензируемая статья — не взаимозаменяемые документы.

Вывод

ESM3 и esmGFP — это сильная демонстрация того, что белковые языковые модели уже могут быть частью реального design-build-test цикла, а не только инструментом для эмбеддингов или предсказания структуры. Но точный смысл результата уже, чем обещает медийный заголовок: это не универсальный автопилот для биодизайна, а аккуратно поставленный и экспериментально подтверждённый кейс управляемой генерации в сложной, но хорошо выбранной задаче.

Если вы работаете с генеративной биологией, главный практический вывод такой: ценность здесь не в лозунге про «500 миллионов лет», а в том, что мультимодальный белковый LM можно встроить в жёстко ограниченный инженерный workflow и получить лабораторно проверяемый hit.

Источники

  1. Simulating 500 million years of evolution with a language modelScience, 2025.
  2. Simulating 500 million years of evolution with a language model — bioRxiv preprint, версия 2.
  3. ESM3: Simulating 500 million years of evolution with a language model — официальный блог EvolutionaryScale, 25 июня 2024 года.
  4. Simulating 500 million years of evolution with a language model — запись PubMed с датами электронной и печатной публикации.
  5. EvolutionaryScale Launches with ESM3: A Milestone AI Model for Biology — официальный пресс-релиз AWS / Amazon, 25 июня 2024 года.
  6. GitHub – evolutionaryscale/esm — официальный репозиторий с кодом и ссылками на ESM3-open.

FAQ

  • Правда ли esmGFP был создан полностью с нуля?

    Не буквально. Авторы оставили модели несколько жёстких опор: ключевые остатки для образования хромофора и фрагмент структуры природного GFP. Остальная часть белка генерировалась и дооптимизировалась моделью.

  • Что означает оценка в 500 миллионов лет?

    Это не реальное «прокручивание эволюции вперёд». Авторы оценивают, насколько далеко esmGFP отстоит от известных GFP по sequence identity, и переводят эту удалённость в время дивергенции с помощью отдельной филогенетической аппроксимации.

  • Можно ли повторить результат на открытом ESM3-open?

    Из самой статьи это не следует. Открытая версия ESM3 имеет 1,4 миллиарда параметров, а судя по приложению препринта, GFP-генерация была связана с базовой 7B-версией модели.

  • Чем ESM3 отличается от моделей вроде AlphaFold?

    AlphaFold-подобные системы в первую очередь предсказывают структуру по заданной последовательности. ESM3 в этой работе использовалась как генеративная модель, которая совместно достраивает структуру, последовательность и функциональные ограничения.

Читайте также