Запись архива

Google Research опубликовала исследование о проблемах трансферного обучения в геномных моделях

Новое исследование Google Research показывает, что перенос знаний из европейских когорт ухудшает точность полигенных рисков в небольших популяциях при росте выборки целевой группы.

Схема исследования Google Research по трансферному обучению для геномных предсказаний
Схема исследования Google Research по трансферному обучению для геномных предсказаний
Изображение из исходного материала

Исследователи из Google Research Джой Пумарин Плоифисут и Кори Маклин опубликовали научную работу, посвященную оценке переносимости моделей полигенного риска (PRS) на недопредставленные популяции. Авторы изучили, как трансферное обучение из крупных европейских когорт взаимодействует с данными локальных выборок при прогнозировании различных клинических показателей.

Исторически сложилось так, что большинство масштабных полногеномных ассоциативных исследований (GWAS) проводились на европейских популяциях. Из-за этого при клиническом применении PRS в других этнических группах часто наблюдается падение точности. Различия в структуре генома, частотах аллелей и генетической архитектуре делают прямой перенос моделей неэффективным, а сбор новых массивов данных для каждого региона стоит дорого.

Por que importa

Для поиска оптимального баланса ученые проанализировали данные британского биобанка UK Biobank и японского Biobank Japan. В фокус внимания попали восемь клинических признаков, включая индекс массы тела, уровень холестерина, артериальное давление и показатели крови. В ходе работы тестировались три метода интеграции данных: линейные модели elastic net на основе готовых вариантов, межпопуляционный мета-анализ и специализированный фреймворк PRS-CSx.

Ключевые факты

Параметр | Значение
— | —
Источники данных | UK Biobank (UKB) и Biobank Japan (BBJ)
Изученные признаки | 8 клинических маркеров (ИМТ, холестерин, давление, кровяные тельца)
Порог переключения | Около 15 000 образцов целевой группы
Авторы | Джой Пумарин Плоифисут, Кори Маклин (Google Research)

Результаты экспериментов показали неожиданную закономерность. Использование европейских данных в качестве базовой разметки помогает повысить точность, когда объем выборки целевой популяции крайне мал — например, на уровне 5 000 образцов. Однако по мере того, как размер целевой когорты увеличивается, совместное обучение с внешними данными начинает тормозить локальный прогресс.

Для большинства изученных фенотипов переломный пункт наступает при достижении примерно 15 000 образцов в целевой группе. Превышение этого порога и одновременное добавление более чем 5 000 записей из британского биобанка приводит к деградации точности прогноза по сравнению с обучением модели исключительно на локальных данных.

Степень падения точности напрямую зависит от генетической консервативности конкретного признака. Для характеристик с высокой степенью разделения генома между популяциями, таких как уровни липидов или глюкозы в крови, негативный эффект от использования далеких вневыборочных данных проявляется быстрее и резче. Признаки с высокой корреляцией генома между популяциями сохраняют пользу от внешней помощи до достижения больших объемов целевой выборки.

Полученные выводы важны для исследователей и разработчиков, проектирующих алгоритмы машинного обучения в медицине и биологии. Исследование демонстрирует, что слепое увеличение обучающей выборки за счет чужеродных доменов данных может снижать точность моделей при достижении критической массы локальных наблюдений. Проектировщикам диагностических инструментов необходимо учитывать архитектуру конкретных признаков, а не полагаться исключительно на масштаб датасетов.

Источник: Google Research Blog, https://research.google/blog/transfer-learning-for-genomic-prediction-in-underrepresented-populations/

Datos clave

Punto Detalle
Fuente Google Research Blog
Fecha 2026-09-03T18:20:31+00:00
Tema Transfer learning for genomic prediction in underrepresented populations