周启涛生物技术工作室
基因组与遗传2025/12/09· 编译自 Nature Genetics

IF31.7|FAME揭示多基因背景对SNP效应的广泛调控

新方法FAME在UK Biobank中检测到16个边际上位信号,多基因背景对变异效应的影响可达GWAS效应的12倍。

新方法FAME在UK Biobank中检测到16个边际上位信号,多基因背景对变异效应的影响可达GWAS效应的12倍。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

上位性(epistasis)是理解复杂性状遗传结构的关键,可能解释缺失遗传力、跨群体效应差异及预测模型迁移性差等问题。传统方法通常穷举SNP对,计算量大且多重检验负担重;另一类方法聚焦边际上位性(marginal epistasis),检验单个SNP的效应是否被个体的多基因背景所调节。这类方法通过聚合弱信号提高检验效能,但需要大规模样本。然而,在生物库规模数据上估计边际上位性面临巨大计算挑战。

科学问题

卡在哪里: 现有边际上位性检验方法如MAPIT无法扩展到数十万样本和数十万SNP的数据规模,而基于方差分量的方法计算成本高昂,难以在生物库级别应用。

本文要回答: 开发一种高效算法FAME,能够在生物库规模数据上检验边际上位性,并应用于UK Biobank的53个数量性状,揭示多基因背景对SNP效应的调控。

技术路线

作者主要用了:FAME算法、随机化矩估计、方差分量模型、UK Biobank、All of Us

作者提出FAME(FAst Marginal Epistasis test),利用随机化矩估计(Method-of-Moments)近似计算方差分量,将计算复杂度从O(N²M)降至O(NMB),其中B为随机向量数(通常取100)。该方法联合建模加性效应和边际上位效应,并通过回归掉目标SNP所在LD区块内的加性效应来保证校准。在模拟中验证了校准性、稳健性和功效后,作者将FAME应用于UK Biobank中291,273名无关英国白人个体的53个数量性状,对每个性状的GWAS显著SNP进行边际上位性检验。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了边际上位模型示意图。给定四个SNP(x1-x4),以x3为目标SNP,模型将表型y分解为所有SNP的加性效应、目标SNP与其余SNP的成对交互效应以及环境噪声。加性效应β和交互效应α分别服从方差为σ_g²/M和σ_gxg,t²/(M-1)的正态分布,通过联合估计这两个方差分量来检验边际上位性。

核心亮点

亮点 1|FAME计算高效且校准良好

FAME在模拟数据中表现出良好的校准性,当目标SNP来自GWAS时,通过回归掉LD区块内SNP的加性效应可消除P值膨胀。在N=291,273、M=459,792的模拟中,即使边际上位方差分量低至0.005,FAME仍具有≥90%的检验功效(P<5×10⁻⁸)。计算上,FAME可在约6小时内完成50万个体、50万SNP的全基因组边际上位检验,内存需求仅32GB,远优于MAPIT(后者在2万个体、1万SNP时需超过3天)。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了FAME的校准、功效和计算效率。a为校准结果:在无边际上位效应的模拟中,FAME的P值均匀分布。b为功效曲线:随边际上位方差分量增加,功效迅速上升。c为估计准确性:边际上位方差分量估计接近真实值。d为运行时间:FAME在50万个体、50万SNP时约6小时。

亮点 2|UK Biobank中检测到16个边际上位信号

在53个数量性状中,FAME对15,601个LD-pruned的GWAS显著SNP进行检验,发现21个显著性状-SNP对(P<5×10⁻⁸/53),进一步回归掉目标SNP所在LD区块的加性效应后,16个信号在12个性状中保持显著。这些信号涉及BMI、尿酸、ALT、睾酮、脂蛋白A等性状。内部复制(UKBB拆分)和外部复制(All of Us)均验证了信号的稳健性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a展示了53个性状中边际上位位点的曼哈顿图,彩色形状表示显著性状-SNP对(P<5×10⁻⁸/53),带彩色三角形的位点在回归掉LD区块内SNP后仍显著。图3b显示局部和远端边际上位信号的分布。图3c比较了边际上位遗传力(h²_gxg,t)与GWAS遗传力(h²_gwas,t),发现前者平均约为后者的12倍。

亮点 3|边际上位信号可定位到局部和远端

通过将交互SNP按染色体分区,作者发现16个位点中5个具有显著的局部边际上位效应(同染色体),12个具有显著的远端效应(跨染色体)。进一步的全基因组成对交互分析(GxGWAS)显示,显著的成对交互几乎都位于目标SNP附近(平均距离699kb,r²<0.10),表明信号并非由LD驱动。唯一的跨染色体交互是rs72654473(APOE附近)与rs6935921(LPA附近)对脂蛋白A的影响。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了边际上位信号的复制结果。a为UKBB内部复制,发现队列中3个显著信号均在复制队列中显著(P<0.05/3)。b为All of Us外部复制,5个可测试的信号全部显著(P<0.05/5)。误差棒表示95%置信区间。

亮点 4|边际上位效应解释的方差超过GWAS效应

对16个显著位点,边际上位遗传力(h²_gxg,t)估计在10⁻³到10⁻²量级,平均比相应SNP的GWAS遗传力(h²_gwas,t)大约12倍(范围0.59-43.89)。两者相关性很弱(Pearson ρ=0.022),表明边际上位效应并非简单地与加性效应成比例。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了三个具体交互对的效应。a为rs6935921与rs72654473对脂蛋白A的交互:rs6935921-T等位基因减弱rs72654473的效应。b为rs72613567与rs738409对ALT的交互,c为rs58542926与rs738409对ALT的交互。误差棒为1000次bootstrap的95%置信区间。

亮点 5|交互SNP富集调控元件和转录因子结合位点

对每个显著位点选取交互P值最小的1000个SNP对,合并后与GWAS背景比较,发现交互SNP在RegulomeDB功能注释上显著富集(P=0.033)。HOMER motif分析显示交互SNP富集多个已知(FDR<0.05)和de novo(P<1×10⁻¹²)转录因子结合位点,尤其是螺旋-环-螺旋结构域、GATA和核激素受体锌指结构域转录因子,这些与代谢性状调控相关。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: FAME算法、随机化矩估计、方差分量模型、UK Biobank、All of Us
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事复杂性状遗传学、统计遗传学或生物信息学分析的研究者,尤其是关注上位性和遗传力估计的同行。

带走一句

边际上位性检验可以揭示多基因背景对单个变异效应的调控,FAME的高效性使其适用于生物库规模数据,为复杂性状遗传结构解析提供了新工具。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。