Google Research Blog

Transfer learning for genomic prediction in underrepresented populations

8.5内容质量
Transfer learning for genomic prediction in underrepresented populations

TL;DR · AI 摘要

迁移学习在跨人群基因组预测中提升小样本群体准确性,但大样本时效果下降,需结合目标群体特异性数据优化模型。

核心要点

  • 迁移学习在目标群体样本量<10万时提升PRS准确性,但样本量>10万后效果下降
  • UKB与BBJ数据集验证了跨人群遗传预测的复杂性,8个性状的遗传结构差异显著
  • 弹性网络方法在跨种族变异关联分析中表现优于传统GWAS

结构提纲

按章节快速跳转。

  1. 揭示欧洲中心GWAS在非欧洲人群中的预测准确性缺陷

  2. 提出基于UKBBBJ数据集的迁移学习框架验证方案

  3. 构建八个性状的跨人群PRS性能评估矩阵

  4. 迁移学习在小样本提升效果但大样本存在性能拐点

  5. 弹性网络方法有效捕捉跨种族遗传关联

  6. 提出混合GWAS与迁移学习的渐进式模型训练策略

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 跨人群基因组预测迁移学习
    • 方法论
      • UKB数据源
      • BBJ数据源
      • 弹性网络方法
    • 实验发现
      • 样本量拐点效应
      • 性状特异性差异
      • 模型性能衰减
    • 实践建议
      • 混合GWAS策略
      • 渐进式训练框架

金句 / Highlights

值得收藏与分享的关键句。

#Genomics#Transfer Learning#GWAS#Genetic Risk Prediction
打开原文

在代表性不足人群中进行基因组预测的迁移学习

2026年9月3日

Joey Poomarin Phloyphisut,软件工程师,和Cory McLean,高级软件工程师,Google Research

我们评估了改进跨人群遗传风险预测的方法,发现虽然从欧洲人群队列中进行迁移学习可以提升小规模代表性不足人群的预测效果,但当目标人群样本量增加时,预测准确性会显著下降,尤其是对于具有人群特异性遗传结构的性状。

快速链接

  • 分享 复制链接 ×

多基因风险评分(PRS)用于从遗传变异预测疾病风险。它们通常整合数百至数百万个遗传变异的影响。然而,目前其在临床决策中的应用率较低,部分原因是历史上全基因组关联研究(GWAS)几乎只评估了欧洲人群,导致在非欧洲人群中应用时准确性严重下降。这些准确性差异源于跨人群遗传结构、人群结构和变异等位基因频率的差异。

此外,对数十万个体进行全新GWAS研究对大多数医疗系统来说成本过高。从现有的以欧洲人群为中心的GWAS中进行迁移学习,将这些大规模结果与目标人群特异性的GWAS相结合,提供了一种潜在解决方案。

为此,在这篇博客文章中,我们描述了一项研究,评估目标非欧洲人群中PRS的表现,同时改变用于构建预测模型的目标人群和欧洲人群的规模,涉及八个临床性状。具体而言,我们评估了在英国生物库(UKB)中从数十万欧洲个体确定的PRS在生物库日本(BBJ)样本中的可迁移性,BBJ是一个包含近20万日本个体的深度表型队列。我们的主要目标是提供系统性的实证指南,说明如何进行跨人群GWAS和PRS模型训练,以优化目标人群中的预测性能。

GWAS人群规模对目标祖先PRS表现的影响

两个大规模、深度基因型和表型数据集(UKB和BBJ)的存在,使我们能够进行数据集消融实验,系统评估PRS表现与样本量之间的关系。我们选择了在两个群体中均测量的八个临床相关性状进行评估:体重指数(BMI)、收缩压、舒张压、红细胞计数、白细胞计数、高密度脂蛋白胆固醇(HDL)、低密度脂蛋白胆固醇(LDL)和血糖。在UKB中,由测量的遗传变异(单核苷酸多态性遗传度)解释的性状方差估计值范围为0.07–0.28。

使用三种方法评估PRS表现的可迁移性:

  • UKB - 发现 GWAS + 弹性网络:探讨欧洲和日本人群中直接变异的可转移性。对于每个性状,我们首先通过对 UKB 欧洲全人群运行 GWAS,筛选出在 BBJ 日本数据集中也存在的独立变异,从而识别出欧洲特异性的遗传关联。使用这些变异作为输入,我们通过在不同组合的 BBJ 和 UKB 样本上训练弹性网络模型,计算目标人群的 PRS。具体而言,我们将 12 至 13 个 BBJ 样本量与 7 个 UKB 样本量进行配对。这为每个性状生成 96 至 104 个 PRS 模型。
  • 荟萃分析 + 弹性网络:探讨在变异发现过程中混合日本人群数据的影响。首先,我们对 UKB 欧洲全人群和抽样的 BBJ 日本数据集运行 GWAS。随后,我们使用荟萃分析将这些遗传关联合并,生成最终的变异集。使用这些变异,我们在混合的 UKB/BBJ 数据集上训练弹性网络模型,以确定目标人群的 PRS。
  • PRS-CSx:探讨一种设计用于处理人群间连锁不平衡多样性的 PRS-CSx 模型。我们对每个性状的 UKB 欧洲全样本和抽样的 BBJ 日本样本应用 PRS-CSx 模型。由于 PRS-CSx 模型为每个群体提供两种不同的评分,我们还拆分验证集以找到两个评分之间的最佳线性组合。

在所有实验中,PRS 模型均在相同的 BBJ 验证集上进行评估。

根据 image_width 确定适当的宽度

对于移动设备上的图片,使用默认宽度

跨祖先基因组预测的实验设计。a) 主要实验探讨在应用通过大规模欧洲 GWAS 发现的变异时,不同数量的欧洲和日本样本对弹性网络性能的影响。b) 荟萃分析实验将人群特异性的 GWAS 结果整合到用于弹性网络模型开发的变异生成中。c) PRS-CSx 实验在多种人群特异性样本量上拟合 PRS-CSx 模型。

本研究中八个性状在 UKB 和 BBJ 中的样本量。

更多数据并不总是跨人群 PRS 预测的更好选择

对于每个实验,我们使用皮尔逊相关系数量化模型性能。如预期的那样,当目标人群数据有限或不存在时,欧洲发现数据提供了有用的基线。然而,当样本量达到 15k 或更多时,目标人群特异性模型表现更优,因为与外部欧洲数据的联合训练似乎限制了通过更高采样获得的目标人群准确性提升。

BBJ 样本中 HDL 胆固醇的 PRS 性能作为 BBJ 和 UKB 样本量的函数:该滴定曲线展示了如何纳入样本外数据实际上会降低目标人群的预测性能。在 BBJ 样本量超过 15,000 时,加入超过 5,000 个 UKB 样本相比仅使用目标人群数据进行训练,预测性能反而下降。

这一令人惊讶的观察结果在我们研究的所有表型中均成立。当目标样本量极小(例如 5,000 个样本)时,在训练过程中合并欧洲 UKB 数据可提供有价值的统计提升。随着用于训练 PRS 模型的目标样本量增加,跨人群合并的益处逐渐减弱。

尽管这一趋势在不同表型中均成立,但使用欧洲数据的成功率下降的交叉点高度依赖于所研究的具体性状。我们可以通过跨人群的遗传相关性量化“共享遗传”的程度。我们观察到,“保守”性状(即两个群体间遗传相关性较高的性状)在目标人群特异性训练数据达到平衡前,能够保留使用UKB欧洲训练数据的益处,直到目标样本量达到25-40k+的规模。

对于具有跨人群共享遗传结构的性状,BBJ样本中PRS性能随BBJ和UKB样本量变化的趋势:当BBJ样本量超过40k时,最佳UKB样本量从最大值开始下降。

与之形成鲜明对比的是,血脂水平(HDL、LDL)和血糖在BBJ样本量超过一定阈值后,最佳UKB样本量均小于最大值,且最佳样本量本身也更小。这些高度人群特异的性状从UKB数据中获益较少,因为该数据与目标人群的分布差异更大。

对于具有跨人群独特遗传结构的性状,BBJ样本中PRS性能随BBJ和UKB样本量变化的趋势:与保守性状不同,这些更具人群特异性的表型表现出更早的交叉点。

元分析和PRS-CSx的影响

上述实验将PRS模型的输入变异限制在UKB欧洲人群中发现的变异,排除了BBJ样本中任何特异性状相关的变异。为了扩展分析以涵盖这些变异,我们创建了两种额外的预测方法。

首先,我们在每个BBJ样本量上运行GWAS。第一种新方法使用完整的UKB GWAS和特定样本量的BBJ GWAS进行跨人群元分析,以识别候选变异,然后在这些变异上拟合弹性网络。第二种方法使用PRS-CSx结合两组GWAS汇总统计数据。

通过跟踪元分析和PRS-CSx在不同发现样本量下的净性能增益,我们观察到BBJ样本量对性能的影响差异。

对于保守性状,元分析的影响较小,这主要归因于BBJ GWAS样本量显著较小导致的统计功效下降。然而,对于人群特异性性状如HDL和LDL(在较小程度上也包括血糖),元分析显著优于单人群发现。这些增益主要源于弹性网络变异输入的调整:在使用10,000个或更少BBJ样本进行预测时,训练中包含UKB欧洲样本略微提高了预测性能。这一改善在BBJ样本量较大时未被观察到。

由于PRS-CSx动态加权人群特异性模型,其性能理论上对保守性状与人群特异性性状的敏感度较低。然而,我们观察到该模型需要比弹性网络模型更多的数据才能表现良好。对于目标样本量低于25k的情况,PRS-CSx在除BMI外的所有表型中表现均不如最强的弹性网络模型。当样本量接近100k时,PRS-CSx在除血糖外的所有表型中均匹配或超过了最佳模型的性能。

结论

对跨人群基因组预测的系统评估表明,在将多基因风险评分(PRS)应用于代表性不足的人群时,更大的外部人群数据集并不总是有益的。具体而言,尽管从英国生物银行(UK Biobank)的大规模欧洲队列中进行迁移学习在目标人群规模较小时(英国生物银行日本队列样本数少于15,000)提供了统计优势,但随着英国生物银行日本(BBJ)样本量的增加,这种迁移学习反而降低了预测准确性。这种性能交叉现象具有特征依赖性:遗传保守性特征(如BMI)在更大样本量下仍能保持外部数据整合的优势,而人群特异性特征(如血脂和血糖)在样本量较少时则表现出优势减弱。重要的是,先进的多祖先方法(如PRS-CSx)需要大量目标人群样本才能优于简单方法,而跨人群元分析在较小样本量下对人群特异性特征提供了稳健的优势。最终,这些发现强调,要在多样化人群中优化预测性能,需要同时扩大本地多样化生物库的规模,并根据特征遗传力和样本量仔细选择定制化的建模策略。

致谢

我们衷心感谢日本生物库(Biobank Japan)以及RIKEN和东京大学医学科学研究所的合作者,使本研究得以实现,同时感谢谷歌的其他合作者:Babak Behsaz、Andrew Carroll、Farhad Hormozdiari和Taedong Yun。我们还要感谢Hiroki Kayama和Joe Ledsam提供的机构支持,以及Michael Brenner和Katherine Chou的领导支持。

  • 标签:
  • 一般科学
  • 机器智能

其他相关文章

  • 2026年9月3日 一项连接组学里程碑:绘制完整雄性果蝇大脑 一般科学 · 健康与生物科学 · 机器智能 · 开源模型与数据集
  • 2026年9月1日 利用深度学习从太空绘制全球甲烷排放图 气候与可持续性 · 地球AI · 机器智能
  • 2026年8月31日 TimesFM-3:用于多变量预测的零样本基础模型 数据管理 · 机器智能 · 产品

×

五张热图展示了不同UKB和BBJ样本量下共享遗传特征的预测准确性。

一张表格列出了UKB和BBJ数据集中八个身体和血液学特征的样本量。

一条折线图显示随着UKB和BBJ样本量增加,HDL预测相关性提高并发生交叉。

八条折线图比较了三种预测模型在不同特征样本量下的皮尔逊相关性。

三张热图展示了不同UKB和BBJ样本量下独特遗传特征的预测准确性。

一张流程图概述了三种基因组预测模型——弹性网络(ElasticNet)、元分析(Meta-Analysis)和PRS-CSx——使用BBJ和UKB数据集的过程。