IF31.7|Quickdraws:变分推断提升混合模型GWAS功效
用贝叶斯机器学习同时实现高功效与高扩展性,在UK Biobank多发现5%关联。
用贝叶斯机器学习同时实现高功效与高扩展性,在UK Biobank多发现5%关联。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
全基因组关联研究(GWAS)是解析复杂性状和疾病遗传基础的核心手段,现代生物样本库的规模扩张带来了海量数据,也催生了可扩展的线性混合模型算法,如BOLT-LMM、SAIGE、FastGWA和REGENIE。其中BOLT-LMM采用贝叶斯混合先验,功效最高但计算昂贵,且对不平衡病例对照比例的二元性状可能产生统计膨胀;SAIGE、FastGWA和REGENIE虽高度可扩展,但依赖正态先验或稀疏遗传关系矩阵,假设性状完全多基因,在非多基因遗传结构下功效受限。因此,当前GWAS方法在计算效率和统计功效之间存在权衡,难以兼得。
科学问题
卡在哪里: 现有可扩展GWAS方法(如REGENIE、FastGWA)假设遗传效应服从正态分布,即完全多基因模型,这导致在非多基因性状(如由少数因果变异驱动)中功效下降。BOLT-LMM虽采用混合先验提升功效,但计算复杂度高,且对低患病率二元性状可能产生统计膨胀。因此,缺乏一种既能建模非多基因遗传结构、又能在百万级样本上高效运行的方法。
本文要回答: 开发一种同时实现高统计功效和高计算效率的GWAS方法,适用于定量性状和二元性状,并在大规模生物样本库中验证其性能。
技术路线
作者主要用了:spike-and-slab先验、随机变分推断、GPU加速、转移学习、LOCO。
Quickdraws采用两阶段流程:模型拟合和检验。在模型拟合阶段,先估计遗传和环境方差组分(定量性状用RHE,二元性状用网格搜索),然后利用贝叶斯回归进行留一染色体(LOCO)预测,其中变异效应采用spike-and-slab先验,以建模非多基因遗传结构。通过随机变分推断和GPU矩阵运算加速,并利用全基因组效应估计初始化LOCO运行以加速收敛。在检验阶段,利用估计的遗传效应计算基于评分的检验统计量,并通过匹配有效样本量进行校准,对二元性状还采用近似Firth逻辑回归校正病例对照不平衡。

图 1 Fig. 1。图1展示模拟数据中Quickdraws相对于线性/逻辑回归在因果变异上的平均χ2统计量提升百分比。a图显示定量性状,随着因果变异数从5,000增加到50,000,Quickdraws的提升幅度从约12%逐渐下降,但在低多基因性下优势明显。b图显示二元性状(患病率30%),Quickdraws在1,250个因果变异时提升约13%,随着因果变异数增加,优势减小。误差棒表示均值标准误。该图直观展示了Quickdraws在非多基因遗传结构下的功效优势。
核心亮点
亮点 1|模拟数据中功效超越现有方法
在50,000样本的模拟中,Quickdraws在定量性状上匹配BOLT-LMM的功效,且显著优于REGENIE、FastGWA和线性回归,尤其在低多基因性下优势更大(例如5,000因果变异时平均χ2提高≥11.46%)。在二元性状中,Quickdraws功效高于SAIGE、REGENIE和FastGWA-GLMM,相当于增加最多13.4%的样本量。同时,Quickdraws在所有模拟条件下(包括群体结构、亲缘关系和低患病率)均保持校准,而REGENIE在高亲缘关系下膨胀,BOLT-LMM在低患病率下膨胀。

图 2 Fig. 2。图2展示UK Biobank真实数据分析结果。a图比较Quickdraws、REGENIE和FastGWA检测到的GWAS位点数量,每个点代表一个性状,垂直线连接同一性状在Quickdraws和REGENIE中的结果,显示Quickdraws在多数性状中检测到更多位点。b图展示在Biobank Japan中复制的位点总数,Quickdraws在定量和二元性状中均复制出更多位点。c图展示Quickdraws与线性回归的衰减比,两者接近,表明Quickdraws校准良好。
亮点 2|UK Biobank中多发现数千个关联
在405,088名英国白人样本中分析79个定量性状和50个疾病性状,Quickdraws比REGENIE多发现4.97%和3.25%的独立关联,比FastGWA多22.71%和7.07%。在血浆蛋白性状中,Quickdraws比REGENIE多发现5.54%的位点。这些增益在遗传力高或多基因性低的性状中更明显,例如平均血小板体积增加8.04%,站立身高增加26.1%。
亮点 3|复制分析验证新发现关联
利用Biobank Japan和FinnGen的汇总统计进行复制分析,Quickdraws在53个性状中比REGENIE和FastGWA复制出更多位点(二项检验P=0.014和P=7×10^-4)。对于30个定量性状,Quickdraws比REGENIE多复制2.5%,比FastGWA多15.72%;对于23个疾病性状,分别多1.07%和3.38%。复制率在各方法间保持一致,表明新增关联并非假阳性。
亮点 4|计算成本与REGENIE相当
在UK Biobank RAP上,Quickdraws分析50个定量性状(N≈405,000)耗时149.3小时,成本£93;REGENIE耗时50.0小时,成本£24.2;FastGWA耗时128.4小时,成本£37.3。对于50个二元性状,Quickdraws耗时682.3小时,成本£395.9;REGENIE(含Firth回归)耗时869.9小时,成本£506.8;SAIGE耗时12,024.4小时,成本£2,834.9。Quickdraws利用GPU加速,在保持高功效的同时,成本与高度可扩展方法相当,远低于BOLT-LMM。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: spike-and-slab先验、随机变分推断、GPU加速、转移学习、LOCO
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/bulik/ldsc、https://github.com/fastlmm/PySnpTools;本地已克隆:ldsc
- 谁该点开原文: 从事大规模GWAS分析、关注统计功效与计算效率平衡的生物信息学与统计遗传学研究者。
带走一句
Quickdraws证明用贝叶斯机器学习(spike-and-slab先验+变分推断+GPU)可以在不牺牲计算效率的前提下提升GWAS功效,尤其适合非多基因性状和二元性状,值得在大型生物样本库分析中尝试。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。