Запись архива

Anthropic опубликовала датасет 1 440 AI-спроектированных белков: как предсказания соотносятся с реальными экспериментами

Anthropic опубликовала датасет 1 440 AI-спроектированных белков: как предсказания соотносятся с реальными экспериментами

Anthropic опубликовала датасет 1 440 AI-спроектированных белков: как предсказания соотносятся с реальными экспериментами
Anthropic опубликовала датасет 1 440 AI-спроектированных белков: как предсказания соотносятся с реальными экспериментами
Hoofddorp | by TijsB | openverse | by-sa

Anthropic опубликовала на Hugging Face датасет claude-protein-binder-design, содержащий 1 440 AI-спроектированных мини-белков для 16 различных мишеней. Ключевая особенность набора — он включает не только вычислительные предсказания от 10 структурных предикторов, но и результаты реальных лабораторных испытаний из двух независимых лабораторий: Adaptyv и Twist. Это позволяет впервые в открытом доступе сопоставить in silico-оценки с wet-lab-данными в масштабе, достаточном для статистического анализа.

Что содержит датасет

Датасет включает дизайны, сгенерированные Claude (Mythos Preview и Opus 4.8), для 16 антигенов-мишеней. Длина связывающих белков варьируется от 34 до 92 аминокислот. Каждый дизайн сопровождается предсказаниями от 10 структурных предикторов, включая AlphaFold2, ESMFold, OmegaFold и другие модели из семейства IPAE (Inverse Protein Architecture Estimation).

Из 1 440 дизайнов лабораторную проверку прошли 1 320 — 120 образцов не были измерены ни в одной из лабораторий. Подтверждёнными связывающими (binders) признаны 19,5% от проверенных образцов. Это сопоставимо с заявленными Anthropic ранее показателями в 22-35% для отдельных настроек, но важно учитывать, что итоговая цифра сильно зависит от распределения по мишеням.

Главный вывод: мишень важнее генератора

Анализ hit rate по различным факторам показывает доминирующий эффект выбора мишени. Разброс доли успешных связываний между разными антигенами достигает десятков раз — от менее 5% для некоторых мишеней до более 50% для других. При этом различия между генераторами (версиями Claude, методами дизайна последовательности) значительно меньше.

Как отмечают авторы анализа, любое сравнение моделей, не стратифицированное по мишеням, в основном измеряет то, на какие мишени была направлена каждая модель, а не её реальную эффективность. Это критическое замечание для всей области AI-дизайна белков: без контроля по мишеням бенчмарки могут вводить в заблуждение.

Как структурные предикторы предсказывают успех

Исследователи оценили дискриминационную способность каждого из 10 структурных предикторов по метрике AUC-ROC. Результаты варьируются, но ни один предиктор не показывает выдающейся точности в одиночку. Комбинирование предсказаний (consensus scoring) улучшает результаты, однако даже лучшие комбинации не достигают уровня, при котором можно было бы отказаться от экспериментальной проверки.

Практический вывод для исследователей: полагаться на один структурный предиктор для отбора кандидатов рискованно. Рекомендуется использовать ансамбль моделей и учитывать, что предсказания лучше работают для одних мишеней и хуже для других.

Расхождение между лабораториями

Отдельный важный результат — измерение disagreements между двумя лабораториями, Adaptyv и Twist. Даже при тестировании одних и тех же дизайнов результаты не всегда совпадают. Это напоминание о том, что экспериментальные данные тоже содержат шум, и часть «неудач» AI-дизайна может объясняться вариабельностью лабораторных протоколов, а не качеством предсказаний.

Что это значит для практиков

Для команд, работающих с AI-дизайном белков, датасет Anthropic даёт несколько практических уроков:

  • Стратификация по мишеням обязательна. Любое сравнение генераторов или методов без учёта мишени статистически некорректно.
  • Consensus scoring работает, но не идеально. Комбинирование нескольких структурных предикторов повышает точность, но не устраняет необходимость в экспериментальной проверке.
  • Ожидаемый hit rate зависит от мишени больше, чем от модели. Планирование экспериментов должно учитывать это: для сложных мишеней потребуется больше кандидатов.
  • Лабораторные данные не являются абсолютной истиной. Расхождения между лабораториями — реальность, которую стоит закладывать в дизайн экспериментов.

Контекст и ограничения

Датасет опубликован на фоне растущего интереса к применению AI в белковом дизайне. Anthropic ранее демонстрировала способность Claude проектировать связывающие белки на уровне ведущих экспертов, а в некоторых случаях — с более высокой аффинностью. Однако открытая публикация полного датасета с сырыми данными — шаг в сторону воспроизводимости, который пока редко встречается в индустрии.

Ограничения анализа: датасет охватывает только 16 мишеней, и все дизайны выполнены моделями Anthropic. Выводы могут не обобщаться на другие семейства белков или другие генеративные модели. Кроме того, часть дизайнов не прошла лабораторную проверку, что создаёт потенциальное смещение в выборке.

Тем не менее, для исследователей, работающих на стыке AI и структурной биологии, датасет становится ценным ресурсом для калибровки собственных пайплайнов и валидации методов предсказания.

Источники