
Исследователи из Google Research Джой Пумарин Плоифисут и Кори Маклин опубликовали научную работу, посвященную оценке переносимости моделей полигенного риска (PRS) на недопредставленные популяции. Авторы изучили, как трансферное обучение из крупных европейских когорт взаимодействует с данными локальных выборок при прогнозировании различных клинических показателей.
Исторически сложилось так, что большинство масштабных полногеномных ассоциативных исследований (GWAS) проводились на европейских популяциях. Из-за этого при клиническом применении PRS в других этнических группах часто наблюдается падение точности. Различия в структуре генома, частотах аллелей и генетической архитектуре делают прямой перенос моделей неэффективным, а сбор новых массивов данных для каждого региона стоит дорого.
Por que importa
Для поиска оптимального баланса ученые проанализировали данные британского биобанка UK Biobank и японского Biobank Japan. В фокус внимания попали восемь клинических признаков, включая индекс массы тела, уровень холестерина, артериальное давление и показатели крови. В ходе работы тестировались три метода интеграции данных: линейные модели elastic net на основе готовых вариантов, межпопуляционный мета-анализ и специализированный фреймворк PRS-CSx.
Ключевые факты
Параметр | Значение
— | —
Источники данных | UK Biobank (UKB) и Biobank Japan (BBJ)
Изученные признаки | 8 клинических маркеров (ИМТ, холестерин, давление, кровяные тельца)
Порог переключения | Около 15 000 образцов целевой группы
Авторы | Джой Пумарин Плоифисут, Кори Маклин (Google Research)
Результаты экспериментов показали неожиданную закономерность. Использование европейских данных в качестве базовой разметки помогает повысить точность, когда объем выборки целевой популяции крайне мал — например, на уровне 5 000 образцов. Однако по мере того, как размер целевой когорты увеличивается, совместное обучение с внешними данными начинает тормозить локальный прогресс.
Для большинства изученных фенотипов переломный пункт наступает при достижении примерно 15 000 образцов в целевой группе. Превышение этого порога и одновременное добавление более чем 5 000 записей из британского биобанка приводит к деградации точности прогноза по сравнению с обучением модели исключительно на локальных данных.
Степень падения точности напрямую зависит от генетической консервативности конкретного признака. Для характеристик с высокой степенью разделения генома между популяциями, таких как уровни липидов или глюкозы в крови, негативный эффект от использования далеких вневыборочных данных проявляется быстрее и резче. Признаки с высокой корреляцией генома между популяциями сохраняют пользу от внешней помощи до достижения больших объемов целевой выборки.
Полученные выводы важны для исследователей и разработчиков, проектирующих алгоритмы машинного обучения в медицине и биологии. Исследование демонстрирует, что слепое увеличение обучающей выборки за счет чужеродных доменов данных может снижать точность моделей при достижении критической массы локальных наблюдений. Проектировщикам диагностических инструментов необходимо учитывать архитектуру конкретных признаков, а не полагаться исключительно на масштаб датасетов.
Источник: Google Research Blog, https://research.google/blog/transfer-learning-for-genomic-prediction-in-underrepresented-populations/
Datos clave
| Punto | Detalle |
|---|---|
| Fuente | Google Research Blog |
| Fecha | 2026-09-03T18:20:31+00:00 |
| Tema | Transfer learning for genomic prediction in underrepresented populations |