IF31.7|家系GWAS统一估计器提升直接遗传效应检验效能
纳入无亲缘样本并开发稳健估计器,直接遗传效应估计效能最高提升106.5%。
纳入无亲缘样本并开发稳健估计器,直接遗传效应估计效能最高提升106.5%。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
全基因组关联研究(GWAS)已发现大量基因型-表型关联,但标准GWAS估计的是群体效应,混杂了直接遗传效应(DGE)、间接遗传效应(IGE)和群体分层等。家系GWAS(FGWAS)利用家系内随机遗传变异可无偏估计DGE,但受限于亲本基因型可得性。已有方法如sib-differences和Young et al.的插补法提高了效能,但Young et al.方法忽略大量无亲缘样本,且在强群体结构下产生偏倚。
科学问题
卡在哪里: 现有FGWAS方法未充分利用无亲缘样本,且在强群体分层或近期混合群体中DGE估计存在偏倚。
本文要回答: 开发纳入无亲缘样本的统一估计器,以及稳健于群体结构的估计器,提升DGE估计效能和稳健性。
技术路线
作者主要用了:孟德尔插补、线性混合模型、Balding-Nichols模拟、UK Biobank、MCS。
作者扩展Young et al.的插补方法,将无亲缘样本通过线性插补纳入FGWAS,构建统一估计器;同时开发稳健估计器,仅利用子代基因型相对亲本基因型的随机变异,避免使用等位基因频率信息。通过模拟不同Fst的群体结构评估偏倚和效能,并在UK Biobank的19个表型和MCS的多基因预测中验证。

图 1 Fig. 1。图1展示不同FGWAS和标准GWAS使用的样本子集。UKB White British样本中,sib-difference估计器使用35,259个有同胞基因型的个体,Young et al.估计器使用所有相关样本(含894个双亲基因型和5,316个单亲基因型个体),统一估计器和标准GWAS额外纳入368,629个无亲缘样本。
核心亮点
亮点 1|统一估计器纳入无亲缘样本
统一估计器将无亲缘样本通过线性插补亲本基因型纳入FGWAS,理论有效样本量增益可达50%。在UKB White British样本中,相比sib-differences,DGE估计有效样本量提升46.9%至106.5%;相比Young et al.估计器提升24.5%至42.6%。

图 2 Fig. 2。图2模拟两个等大小亚群体,Fst分别为0、0.001、0.01、0.1,表型无因果遗传效应但亚群体成员解释50%方差。显示sib-difference/robust和NT估计器在所有Fst下无偏倚,标准GWAS偏倚最大,统一和Young et al.估计器在Fst=0.1时出现偏倚。
亮点 2|稳健估计器抵抗群体结构
稳健估计器仅利用子代基因型相对亲本基因型的随机变异,在模拟的强群体结构(Fst=0.1)下无偏倚。在UKB无祖先限制样本中,相比sib-differences,有效样本量提升10.3%至21.0%。

图 3 Fig. 3。图3模拟100个亚群体,Fst分别为0、0.001、0.01、0.1。显示所有家系估计器无显著偏倚,标准GWAS即使调整PCs在Fst>0时仍有偏倚,除非Fst=0.1且调整99个PCs。
亮点 3|模拟揭示偏倚-方差权衡
模拟显示,统一估计器在Fst≤0.01时无偏倚且效能最高,但在Fst=0.1时出现偏倚;稳健估计器和NT估计器在所有Fst下无偏倚。标准GWAS即使调整PCs在复杂结构下仍有偏倚。

图 4 Fig. 4。图4以有效样本量(x轴)和偏倚(y轴)展示偏倚-方差权衡。sib-difference/robust估计器有效样本量为1且无偏倚,Young et al.和统一估计器效能更高但在Fst=0.1时出现偏倚,标准GWAS效能最高但偏倚最大。
亮点 4|统一估计器多基因预测更优
在MCS的欧洲样本中,统一估计器构建的DGE PGI对BMI和GCSE成绩预测最优,对身高与Young et al.估计器持平。在南亚样本中,DGE PGI的预测准确性相对欧洲样本未下降,提示跨祖先预测潜力。

图 5 Fig. 5。图5展示UKB数据中不同估计器相对sib-difference估计器的有效样本量增益,x轴为同胞表型相关性。统一估计器增益随相关性下降,从height的46.9%到subjective well-being的106.5%;robust估计器增益10.3%至21.0%。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 孟德尔插补、线性混合模型、Balding-Nichols模拟、UK Biobank、MCS
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事GWAS和家系分析、关注直接遗传效应估计的遗传学研究者。
带走一句
根据样本群体结构选择合适估计器:同质样本用统一估计器最大化效能,强结构或混合样本用稳健估计器避免偏倚。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。