
Anthropic опубликовала на Hugging Face датасет claude-protein-binder-design, содержащий 1 440 AI-спроектированных мини-белков для 16 различных мишеней. Ключевая особенность набора — он включает не только вычислительные предсказания от 10 структурных предикторов, но и результаты реальных лабораторных испытаний из двух независимых лабораторий: Adaptyv и Twist. Это позволяет впервые в открытом доступе сопоставить in silico-оценки с wet-lab-данными в масштабе, достаточном для статистического анализа.
Что содержит датасет
Датасет включает дизайны, сгенерированные Claude (Mythos Preview и Opus 4.8), для 16 антигенов-мишеней. Длина связывающих белков варьируется от 34 до 92 аминокислот. Каждый дизайн сопровождается предсказаниями от 10 структурных предикторов, включая AlphaFold2, ESMFold, OmegaFold и другие модели из семейства IPAE (Inverse Protein Architecture Estimation).
Из 1 440 дизайнов лабораторную проверку прошли 1 320 — 120 образцов не были измерены ни в одной из лабораторий. Подтверждёнными связывающими (binders) признаны 19,5% от проверенных образцов. Это сопоставимо с заявленными Anthropic ранее показателями в 22-35% для отдельных настроек, но важно учитывать, что итоговая цифра сильно зависит от распределения по мишеням.
Главный вывод: мишень важнее генератора
Анализ hit rate по различным факторам показывает доминирующий эффект выбора мишени. Разброс доли успешных связываний между разными антигенами достигает десятков раз — от менее 5% для некоторых мишеней до более 50% для других. При этом различия между генераторами (версиями Claude, методами дизайна последовательности) значительно меньше.
Как отмечают авторы анализа, любое сравнение моделей, не стратифицированное по мишеням, в основном измеряет то, на какие мишени была направлена каждая модель, а не её реальную эффективность. Это критическое замечание для всей области AI-дизайна белков: без контроля по мишеням бенчмарки могут вводить в заблуждение.
Как структурные предикторы предсказывают успех
Исследователи оценили дискриминационную способность каждого из 10 структурных предикторов по метрике AUC-ROC. Результаты варьируются, но ни один предиктор не показывает выдающейся точности в одиночку. Комбинирование предсказаний (consensus scoring) улучшает результаты, однако даже лучшие комбинации не достигают уровня, при котором можно было бы отказаться от экспериментальной проверки.
Практический вывод для исследователей: полагаться на один структурный предиктор для отбора кандидатов рискованно. Рекомендуется использовать ансамбль моделей и учитывать, что предсказания лучше работают для одних мишеней и хуже для других.
Расхождение между лабораториями
Отдельный важный результат — измерение disagreements между двумя лабораториями, Adaptyv и Twist. Даже при тестировании одних и тех же дизайнов результаты не всегда совпадают. Это напоминание о том, что экспериментальные данные тоже содержат шум, и часть «неудач» AI-дизайна может объясняться вариабельностью лабораторных протоколов, а не качеством предсказаний.
Что это значит для практиков
Для команд, работающих с AI-дизайном белков, датасет Anthropic даёт несколько практических уроков:
- Стратификация по мишеням обязательна. Любое сравнение генераторов или методов без учёта мишени статистически некорректно.
- Consensus scoring работает, но не идеально. Комбинирование нескольких структурных предикторов повышает точность, но не устраняет необходимость в экспериментальной проверке.
- Ожидаемый hit rate зависит от мишени больше, чем от модели. Планирование экспериментов должно учитывать это: для сложных мишеней потребуется больше кандидатов.
- Лабораторные данные не являются абсолютной истиной. Расхождения между лабораториями — реальность, которую стоит закладывать в дизайн экспериментов.
Контекст и ограничения
Датасет опубликован на фоне растущего интереса к применению AI в белковом дизайне. Anthropic ранее демонстрировала способность Claude проектировать связывающие белки на уровне ведущих экспертов, а в некоторых случаях — с более высокой аффинностью. Однако открытая публикация полного датасета с сырыми данными — шаг в сторону воспроизводимости, который пока редко встречается в индустрии.
Ограничения анализа: датасет охватывает только 16 мишеней, и все дизайны выполнены моделями Anthropic. Выводы могут не обобщаться на другие семейства белков или другие генеративные модели. Кроме того, часть дизайнов не прошла лабораторную проверку, что создаёт потенциальное смещение в выборке.
Тем не менее, для исследователей, работающих на стыке AI и структурной биологии, датасет становится ценным ресурсом для калибровки собственных пайплайнов и валидации методов предсказания.