周启涛生物技术工作室
基因组与遗传2025/02/03· 编译自 Nature Genetics

IF31.7|精细祖先成分揭示人类群体间遗传效应高度保守

用127个祖先成分替代主成分,GWAS分层校正更干净;混合个体中效应量几乎不随祖先背景改变。

用127个祖先成分替代主成分,GWAS分层校正更干净;混合个体中效应量几乎不随祖先背景改变。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

全基因组关联研究(GWAS)已发现大量影响复杂性状的遗传位点,但群体分层是主要混杂因素,可导致假阳性。主成分分析(PCA)和混合模型是常用校正方法,但精细的群体结构仍可能扭曲效应量估计。多基因评分(PGS)在跨群体预测时准确性下降,部分归因于因果变异在不同群体中频率和连锁不平衡(LD)模式不同,但基因-环境或基因-基因互作是否也导致效应量差异仍存在争议。此前有研究利用混合个体分解局部祖先,发现局部互作并非主要因素,但跨大陆祖先个体间效应量差异仍可能由基因-环境互作引起。

科学问题

卡在哪里: 现有方法难以有效区分局部LD差异与全局效应量变化对PGS跨群体可移植性的影响;同时,基于主成分的校正可能过度或不足,导致假阳性或假阴性。

本文要回答: 开发精细祖先推断流程和评估效应量相似性的统计方法,并应用于UK Biobank数据,以改进分层校正并量化跨群体遗传效应一致性。

技术路线

作者主要用了:ChromoPainter、fineSTRUCTURE、NNLS、HAPMIX、GWAS、LDSC、PGS、ANCHOR

作者首先构建了一个包含127个全球区域的祖先参考面板,利用ChromoPainter和fineSTRUCTURE对参考单倍型进行聚类和标注。然后对UK Biobank的487,409名个体的基因型进行定相和填补,再用ChromoPainter将目标单倍型与参考面板比对,通过非负最小二乘(NNLS)推断每个个体的祖先成分(ACs)。接着,作者比较了ACs与主成分(PCs)在GWAS分层校正中的表现。为了评估效应量相似性,作者开发了ANCHOR方法,利用混合祖先个体的局部祖先信息,分别计算欧洲和非洲祖先片段上的多基因评分(EPGS和APGS),并通过回归模型估计各自对表型的预测能力,从而推断效应量相关性ρ。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了祖先推断流程的主要步骤:输入个体基因型数据,经过定相和填补,与包含127个预聚类群体的绘画参考面板比对,最后通过混合拟合推断每个个体的祖先成分系数。右侧地图显示英国不同地区个体平均祖先成分的地理分布,颜色代表不同区域,表明DNA信息可以预测出生地。

核心亮点

亮点 1|127个祖先成分揭示英国精细群体结构

对434,781名出生于英国或爱尔兰且自报为白人英国/爱尔兰(WBI)的UKB参与者,平均祖先成分为:British–Irish (BI) 94.9%、Dutch 1.35%、Swiss 0.79%、Norwegian 0.49%、Polish 0.29%、Danish 0.19%。对于自报为“其他白人背景”的个体,BI比例降至25.5%。出生在爱尔兰共和国的个体平均爱尔兰祖先为74.2%,包含在98.4%的BI祖先中。此外,41.5%的英国出生个体有超过50%的祖先来自单一区域,其中59.2%与出生地匹配,若扩展到邻近区域则升至82.7%。伦敦的祖先熵最高,表明混合程度最强。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了按出生地分层的UKB WBI个体祖先成分分解。每个条形图代表一个区域,每列是一个个体,颜色对应地图上的区域。左图显示英国境内精细结构,右图显示亚洲、大洋洲和部分东非国家出生个体的祖先构成。可以看出非英国出生个体普遍携带BI祖先,且存在特定模式,如乌干达和肯尼亚出生个体中Gujarat祖先比例较高。

亮点 2|祖先成分校正优于主成分,减少假阳性

以出生地纬度作为对照表型,使用100个PCs校正后仍观察到470个独立关联信号,LDSC截距为1.6608,表明存在严重膨胀。而使用127个ACs校正后,关联信号减少至7个(其中5个与PC结果共享),LDSC截距接近1。对于“英格兰就业评分”这一区域定义性状,PC特有信号中仅18%与既往GWAS信号重叠(OR=1.6, P=0.44),而AC特有信号中71%重叠(OR=18, P=1.8×10⁻¹⁰),且显著富集于教育程度和社会经济地位相关性状(OR=16, P=0.005),提示PC特有信号可能为假阳性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3比较了ACs和PCs在GWAS分层校正中的表现。a和b显示ACs能较好预测PCs,但反向预测较差,说明ACs包含额外信息。c-e分别展示出生地、就业评分和腰围三个性状的GWAS结果,散点颜色表示SNP是否在既往GWAS中显著。AC校正显著减少了出生地性状的关联信号,并在就业评分中富集更多真实信号,在腰围中揭示了PC校正遗漏的位点。

亮点 3|祖先成分校正揭示PC过度校正导致的假阴性

在腰围等99个非区域定义性状中,AC与PC校正的P值和LDSC截距总体相似,但AC校正发现了5个PC校正未检出的独立信号。这些信号位于与特定PC高载荷SNP强LD的区域,例如腰围GWAS中15:84311431:TA:T变异,在OpenTargets中与多种人体测量性状强相关。这表明PC校正可能因局部基因组区域与PC强相关而过度校正,导致假阴性。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4阐释了ANCHOR的原理和模拟结果。a展示局部祖先和全局祖先对PGS预测能力的不同影响。b显示在模拟数据中,当真实ρ=1时,ANCHOR估计的ρ在不同祖先比例分箱中均接近1,验证了方法准确性。c显示真实数据中53个性状的平均ρ估计值在不同祖先比例分箱中均与1重叠,表明效应量高度保守。d以身高为例,展示欧洲祖先片段的βEu与纯欧洲个体相似,而非洲祖先片段βAf显著降低。

亮点 4|ANCHOR估计效应量相关性接近1

对53个UKB数量性状,ANCHOR估计的ρ(欧洲祖先片段效应量与欧洲参考群体效应量之比)在不同全基因组祖先比例分箱中均接近1,联合bootstrap得到总体ρ=0.98±0.07。对于站立身高,欧洲祖先片段的预测能力(βEu)与纯欧洲祖先个体相似,而非洲祖先片段预测能力(βAf)显著降低,解释了PGS可移植性下降主要由局部LD和等位基因频率差异导致,而非基因-基因或基因-环境互作。仅少数性状如FEV1、用力肺活量和坐高显示ρ<1(名义显著),白细胞计数、红细胞计数和白蛋白显示ρ>1(名义显著),但经Bonferroni校正后均不显著。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了53个UKB数量性状的ANCHOR结果。第一列显示每个性状的ρ估计值及95%置信区间,绝大多数包含1。第二列显示在100%非洲祖先个体中欧洲祖先片段的预测能力比值,同样接近1。第三列显示非洲祖先片段的预测能力比值,普遍低于1,反映局部LD差异。少数性状如FEV1显示ρ<1,白细胞计数显示ρ>1,但均未通过多重检验校正。

亮点 5|模拟验证ANCHOR的准确性和均值中心化的必要性

在ρ=1的模拟中,使用均值中心化的EPGS和APGS,96%的性状95%置信区间包含真实值1;而不进行均值中心化则导致严重向下偏倚。在ρ<1的模拟中,ANCHOR估计的ρ保持良好校准。此外,模拟显示非洲祖先片段的预测能力下降幅度小于真实数据,提示真实因果变异可能在群体间频率差异更大,可能与自然选择有关。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

做跨群体PGS时,优先考虑改进因果变异标记(如使用多祖先参考面板或功能注释),而非重新估计效应量;GWAS校正可尝试用精细祖先成分替代或补充主成分。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。