Запись архива

Исследователи MIT представили PottsMPNN — метод генерации белков, не встречающихся в природе

Новая ML-модель PottsMPNN от MIT отходит от копирования природных последовательностей, фокусируясь на физической стабильности белков. Это может изменить подход к дизайну белков для медицины и биотехнологий.

Схема работы фреймворка PottsMPNN от MIT для дизайна белков.
Схема работы фреймворка PottsMPNN от MIT для дизайна белков.
Редакционная тематическая обложка COMRAD404

Исследователи из Массачусетского технологического института (MIT) представили новую модель машинного обучения для дизайна белков — PottsMPNN. Ключевое отличие разработки в том, что она намеренно отходит от воспроизведения последовательностей, которые встречаются в природе. Вместо этого модель оценивает физическую стабильность и энергетическую состоятельность структуры, что, по мнению авторов, является более правильным критерием для создания новых функциональных белков. Результаты исследования опубликованы в журнале PNAS.

Проблема метрик в дизайне белков

Традиционный подход к вычислительному дизайну белков часто оценивает успех модели по тому, насколько точно она воспроизводит последовательность, отобранную эволюцией для конкретной структуры. Как отмечает старший автор работы, профессор биологии и заведующая кафедрой биологии MIT Эми Китинг (Amy E. Keating), этот критерий не является оптимальным для дизайна, особенно когда речь идет о создании совершенно новых, не существующих в природе структур.

«На протяжении многих лет успех в этой области измерялся тем, может ли модель воспроизвести последовательность белка, которую эволюция случайно отобрала. Наша работа показывает, что это не лучший показатель для дизайна белков», — заявила Китинг.

В природе множество различных аминокислотных последовательностей могут сворачиваться в одну и ту же структуру, и одна последовательность может принимать разные формы. Задача ИИ — не копировать одно из возможных решений, а понять, какие последовательности физически способны принять заданную структуру.

Как работает PottsMPNN

Ключевое нововведение PottsMPNN — использование попарного распределения (pairwise distribution) для учета взаимодействий между аминокислотами. Модель рассматривает, как все 20 возможных вариантов аминокислот на одной позиции взаимодействуют со всеми вариантами на соседней позиции. Это позволяет более точно моделировать ландшафт «последовательность-энергия» — то есть то, как замена одной аминокислоты повлияет на стабильность всего белка.

Второй важный элемент — стратегическое использование «шума» (noise) при обучении. Добавление вариаций в структуру белка во время тренировки снижает склонность модели к точному копированию природных последовательностей, увеличивая разнообразие структур, для которых она способна генерировать последовательности.

Третьим элементом стало включение в обучение наборов эволюционно связанных последовательностей. Как признает ведущий автор работы, аспирант Фостер Бирнбаум (Foster Birnbaum), это все еще является некоторой зависимостью от природных данных. Однако PottsMPNN показала, что по мере снижения этой зависимости точность предсказания структурной совместимости и энергии для новых белков возрастает.

Ключевые факты

Параметр Значение
Разработчик Лаборатория Эми Китинг, кафедра биологии MIT
Тип модели ML-фреймворк для генерации аминокислотных последовательностей (Inverse Folding)
Публикация PNAS (Proceedings of the National Academy of Sciences)
Основное новшество Попарное распределение для учета взаимодействий аминокислот + контролируемый шум
Цель Генерация стабильных белков с последовательностями, не встречающимися в природе

Почему это важно для разработчиков и исследователей

Для сообщества, работающего с ИИ в биоинформатике и computational biology, PottsMPNN предлагает альтернативу популярной модели ProteinMPNN, выпущенной в 2022 году. С тех пор, по словам Бирнбаума, ни одна модель не смогла превзойти ее по ключевым показателям, и исследователи пытались понять, в чем причина. PottsMPNN не просто улучшает метрики, а меняет саму цель: вместо воспроизведения природных последовательностей модель учится предсказывать, какие мутации сделают белок стабильным.

Это открывает путь к дизайну белков, которые могут связываться с молекулами, вызывающими заболевания, или выполнять каталитические функции, недоступные природным белкам. Для инженеров, разрабатывающих AI-агенты для научных исследований, это пример того, как отказ от «обучения по образцу» в пользу понимания физических принципов может радикально повысить качество генерации.

Ограничения и перспективы

Исследователи отмечают, что модель может быть дополнительно улучшена и донастроена для конкретных задач, таких как предсказание последствий конкретной мутации. Бирнбаум также подчеркивает, что, хотя PottsMPNN уже демонстрирует превосходство над предшественниками, область дизайна белков находится только в начале пути.

«Когда мы сможем проектировать любой белок, это позволит нам заниматься потенциально пугающим объемом биологической инженерии. Это сложная задача, но я очень оптимистично настроен относительно прогресса биологии в этом столетии», — добавил Бирнбаум.

Источник: MIT News — Looking beyond natural sequences (https://news.mit.edu/2026/looking-beyond-natural-sequences-0827)