IF50.5|SPRTA:百万级系统发育树置信度评估新方法
SPRTA将分支支持从拓扑转向突变历史,让SARS-CoV-2大树的每个分支和样本放置都有了概率解释。
SPRTA将分支支持从拓扑转向突变历史,让SARS-CoV-2大树的每个分支和样本放置都有了概率解释。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
系统发育学在进化生物学和基因组流行病学中处于核心地位,评估系统发育树的置信度至关重要。Felsenstein's bootstrap等方法虽然应用广泛,但计算量巨大,难以处理包含数百万基因组的疫情规模数据。此外,这些方法大多关注分支(clade)的拓扑支持,而基因组流行病学更关心突变历史、谱系起源和样本放置。局部支持方法如aBayes计算效率较高,但基于NNI移动,对大规模数据仍不够全面,且同样受限于拓扑视角。
科学问题
卡在哪里: 现有分支支持方法要么计算量过大,无法扩展到百万级基因组;要么基于拓扑视角,难以解释突变和传播历史。此外,rogue taxa(如不完整序列)会显著降低Felsenstein's bootstrap对许多内部分支的支持,且该方法过于保守,需要三个突变才能给出95%支持。局部方法如aBayes只考虑NNI移动,无法充分探索可能的替代拓扑。
本文要回答: 开发一种计算高效、可扩展至疫情规模、且以突变历史为中心的分支支持方法,用于评估SARS-CoV-2系统发育树中分支和样本放置的置信度。
技术路线
作者主要用了:SPRTA、MAPLE、最大似然、SPR移动、模拟基准、UNREST模型。
作者提出SPRTA方法,基于子树剪枝重接(SPR)移动评估分支支持。对每个分支b,考虑将子分支Sb重新放置到树的其他位置的所有可能SPR移动,通过MAPLE高效计算各替代拓扑的似然,并用归一化似然得到SPRTA支持分数。该方法先进行初步筛选,仅保留似然差异在一个突变事件以内的替代拓扑,再进行分支长度优化。SPRTA在MAPLE中实现,可在树推断过程中同步计算,几乎不增加额外开销。作者通过模拟SARS-CoV-2基因组数据,以突变历史正确性为基准,比较了SPRTA与Felsenstein's bootstrap、UFBoot、TBE、aLRT、aBayes、LBP等方法的性能。

图 1 Fig. 1。图1展示了SPRTA计算分支b支持度的原理。分支b(红色实线)将树分为子分支Sb(黑色三角形)和其余部分T\Sb。SPR移动将Sb重新放置到T\Sb的其他位置(蓝色虚线箭头),每个替代放置代表B的不同进化起源。SPRTA通过比较原始树与所有替代放置的似然来计算b的支持度。
核心亮点
亮点 1|忽略不确定性影响位点特异性突变率估计
忽略系统发育不确定性对全基因组平均核苷酸替代率影响不大,但会显著影响单个位点的突变计数。例如,位点17040因不确定的回复突变而受到强烈影响。其他位点如7926和21595也显示类似模式。通过比较所有突变、仅保留SPRTA支持≥50%的突变、仅保留≥90%的突变,作者发现保守过滤会大幅改变某些位点的突变计数,表明在推断位点特异性突变率时应考虑系统发育不确定性。

图 2 Fig. 2。图2比较了不同分支支持方法在模拟SARS-CoV-2数据集上的运行时间和最大内存使用。x轴为模拟基因组数量,y轴分别为时间(a)和内存(b)。SPRTA的时间和内存需求远低于其他方法,且随数据量增大差距更明显。其他方法的线在数据量增大时提前终止,表示无法完成计算。
补充图

图 3 Fig. 3。图3展示了不同方法对正确推断突变(a)和错误推断突变(b)的平均支持度。所有方法对两类突变都给出高支持,但只有SPRTA对正确突变的支持显著高于错误突变(正确约98-99%,错误约85-90%)。其他方法对两类突变的支持差异很小,无法有效区分。

图 4 Fig. 4。图4左侧为全球SARS-CoV-2系统发育树,按Pango谱系着色。中间放大显示AY.4谱系,标注了T17040C(绿色箭头)和C21846T(蓝色箭头)突变,以及约650个C17040T回复突变(红色圆圈)。右侧展示了一个包含超过16.3万个基因组的C17040T回复亚谱系,其定义分支的SPRTA支持仅为7.6%,最可能的替代起源涉及C27484T回复突变(深蓝色箭头)。

图 5 Fig. 5。图5展示了两个不确定样本放置的例子。左上为Alpha谱系内的一个样本(黑色箭头),在位置27281处无序列信息(N),该样本在当前放置和G27281T突变另一侧(红色箭头)的SPRTA支持均为50%。右下为AY.44谱系内的一个样本,其放置的SPRTA支持为80.5%,不确定性源于两个相互竞争的突变历史。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: SPRTA、MAPLE、最大似然、SPR移动、模拟基准、UNREST模型
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事系统发育学、基因组流行病学、病毒进化分析的研究者,尤其是处理大规模病原体基因组数据的生信人员。
带走一句
SPRTA让大规模系统发育树的每个分支和样本放置都有了概率解释,做疫情规模分析时,别再只看拓扑,要关注突变历史的置信度。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。