IF31.7|SINGER:数百基因组全基因组谱系的贝叶斯推断
新方法SINGER将ARG后验采样加速两个数量级,并提升对模型误设的稳健性。
新方法SINGER将ARG后验采样加速两个数量级,并提升对模型误设的稳健性。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
祖先重组图(ARG)描述了样本基因组的谱系历史,是群体基因组学和生物医学研究的重要工具。在人类等存在重组的物种中,每个基因组位置都有各自的树,相邻位置的树差异极小,全基因组范围内形成数百万棵树。这些树连同重组位点共同构成ARG,其生成模型为“带重组的溯祖过程”。尽管模拟该过程相对直接,但从遗传变异数据推断ARG仍极具挑战,因为可能的ARG空间巨大。ARG可通过逐步确定第n条谱系如何连接到前n-1条基因组的局部ARG来构建,这一过程称为“threading”。利用序列马尔可夫溯祖近似和隐马尔可夫模型,ARGweaver能够对数十条全基因组序列从近似后验分布中采样ARG,但计算量过大,难以扩展到更大样本。
科学问题
卡在哪里: 近期方法虽将ARG重建扩展到数十万基因组,但存在明显局限:首先,扩展性提升往往以关键ARG特征(如溯祖时间和重组事件)的准确性为代价;其次,多数可扩展方法仅重建单一ARG拓扑,忽略了估计不确定性,而准确的ARG采样能改善局部基因树分析等统计推断;第三,现有方法通常假设简单的先验(如恒定大小随机交配群体和中性进化),对违反这些假设的情况不够稳健,而许多人群经历过复杂的 demographic 变化和背景选择。
本文要回答: 本文旨在开发一种贝叶斯方法SINGER,在保持ARGweaver全部功能的同时,将ARG后验采样加速至少一个数量级,并提高对模型误设的稳健性,从而支持数百条全基因组序列的准确推断和不确定性量化。
技术路线
作者主要用了:贝叶斯MCMC、隐马尔可夫模型、threading算法、子图剪枝重接、ARG重标定。
SINGER采用迭代threading方式,每次加入一条单倍型。首先构建以分支为隐藏状态的HMM,通过随机回溯采样连接分支(分支采样);然后以连接时间为隐藏状态,在给定分支下采样连接时间(时间采样)。这种两步法大幅减少了隐藏状态数量,比ARGweaver的HMM快得多。为探索ARG拓扑和分支长度的后验空间,SINGER使用子图剪枝重接(SGPR)MCMC提议,先剪掉一个子图,再向左右扩展,重接步骤利用threading算法从后验采样,而非像Kuhner move那样从先验模拟,从而获得更高的接受率和更好的混合。最后,通过ARG重标定,对节点时间进行单调变换,使推断的突变密度与分支长度对齐,以减轻算法近似带来的偏差,提高对群体大小变化等模型误设的稳健性。

图 1 Fig. 1。图1展示SINGER的threading算法流程:a为分支采样,在部分ARG的每个边际树中采样连接分支(蓝色高亮);b为时间采样,在给定连接分支下采样连接时间;c和d展示SGPR操作,先剪枝后重接,重接使用threading从后验采样,而非从先验模拟,从而提高接受率。
核心亮点
亮点 1|溯祖时间推断更准确
在50条单倍型模拟数据上,SINGER推断的成对溯祖时间最准确,优于ARGweaver、Relate和tsinfer+tsdate;在300条单倍型上,SINGER同样表现最佳。SINGER还准确捕获了CEU群体历史下成对溯祖时间分布的双峰特征,而Relate和tsinfer+tsdate存在系统偏差。此外,SINGER对有效群体大小误设(偏差5倍)的稳健性优于其他方法。

图 2 Fig. 2。图2比较不同方法推断的成对溯祖时间与真实值。a为恒定群体大小下50条序列的结果,SINGER最准确;b为CEU群体历史下的结果,SINGER同样最优;c显示SINGER捕获了溯祖时间分布的双峰;d显示SINGER和Relate的谱系数随时间变化与真实值吻合,而ARGweaver低估、tsdate高估;e显示SINGER的三联体距离最低。
亮点 2|拓扑与重组推断更优
SINGER在树拓扑推断上取得最低的三联体距离,优于ARGweaver、Relate和tsinfer+tsdate。在重组推断方面,SINGER和ARGweaver能准确估计5kb窗口内的重组断点数,而Relate和tsinfer漏掉许多重组事件。SINGER还准确捕获了成对IBD长度分布,tsinfer则显著高估IBD长度。

图 3 Fig. 3。图3评估突变和重组推断。a显示SINGER推断的等位基因年龄比Relate和tsinfer+tsdate更准确;b显示SINGER和ARGweaver对5kb窗口内重组断点数的估计准确,而Relate和tsinfer漏掉许多重组;c显示SINGER准确捕获成对IBD长度分布,tsinfer高估。
亮点 3|后验采样与不确定性量化
SINGER的MCMC采样更接近后验分布:其秩图接近均匀分布,而ARGweaver和Relate呈U形,表明采样欠分散。90%经验可信区间覆盖率:SINGER为85%,ARGweaver为54%,Relate仅为44%。即使ARGweaver使用40倍长的稀释间隔,其表现仍不如SINGER,说明SINGER的混合效率远高于ARGweaver。

图 4 Fig. 4。图4评估MCMC收敛和不确定性量化。a展示SINGER、ARGweaver和Relate的90%经验可信区间;b为秩图,SINGER接近均匀分布,ARGweaver和Relate呈U形;c显示SINGER的CI覆盖率接近名义水平,而其他方法远低于名义水平;d显示SINGER的threading运行时间比ARGweaver快约10倍。
亮点 4|在千人基因组数据中的应用
将SINGER应用于200个非洲个体(5个群体)和英国个体数据,发现群体间溯祖时间分化信号,如MITF、SPCS3、SCN9A等基因区域。利用溯祖分布热图检测到可能的尼安德特人渗入片段,与IBDmix结果一致。在HLA区域,SINGER推断出极古老的溯祖时间,超过人-黑猩猩分歧时间,支持跨物种多态性和平衡选择,而Relate和tsinfer+tsdate未能恢复这些信号。

图 5 Fig. 5。图5展示非洲群体中群体特异性溯祖时间分化信号。a为每个1kb窗口中合并样本平均成对溯祖时间与群体内平均成对溯祖时间的比值,峰值区域用灰色阴影标出,并标注了相关基因(如MITF、SPCS3、SCN9A);b为各群体在峰值区域的平均群体内溯祖时间。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 贝叶斯MCMC、隐马尔可夫模型、threading算法、子图剪枝重接、ARG重标定
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事群体基因组学、统计遗传学或ARG推断方法开发的研究者。
带走一句
SINGER表明,通过改进MCMC算法和threading效率,可以在数百基因组规模上进行ARG后验采样,从而获得更准确的溯祖时间和拓扑推断,并量化不确定性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。