IF36.1|大流行规模系统发育中的速率变异与反复序列错误
MAPLE新模型同时估计位点突变率和错误概率,重建>200万SARS-CoV-2基因组可靠系统发育树。
MAPLE新模型同时估计位点突变率和错误概率,重建>200万SARS-CoV-2基因组可靠系统发育树。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
基因组流行病学已成为区域、国家和全球健康的重要工具,在COVID-19大流行期间尤为突出。系统发育分析是基因组流行病学数据的核心手段,但传统方法主要针对物种间进化设计,难以应对SARS-CoV-2等病原体基因组数据集的庞大规模和低序列分化。近期开发的pandemic-scale系统发育方法如UShER和MAPLE大幅降低了计算需求,但同源性(homoplasies)现象——即系统发育树上反复出现的核苷酸替换——严重影响推断的准确性和可靠性。已有研究表明,SARS-CoV-2中广泛存在的同源性主要由两个因素驱动:高突变率位点和反复出现的序列错误。
科学问题
卡在哪里: 现有系统发育模型要么忽略位点间突变率异质性,要么采用gamma分布等经典方法,计算代价高且难以捕捉SARS-CoV-2中极端的位点特异性突变率变异。同时,序列错误模型通常假设错误概率沿基因组均匀分布,无法识别和校正反复出现的位点特异性错误。
本文要回答: 本文旨在开发计算高效且准确的模型,同时估计位点特异性突变率和序列错误概率,并应用于>200万SARS-CoV-2基因组,重建可靠的全球系统发育树。
技术路线
作者主要用了:UNREST模型、位点特异性速率变异、位点特异性错误模型、EM算法、局部参考、SPR搜索。
作者在MAPLE框架内扩展了UNREST替换模型,引入位点特异性突变率参数和位点特异性错误概率参数,并使用期望最大化(EM)算法联合估计这些参数。通过区分内部枝和末端枝上的替换事件,模型能够区分真实突变和序列错误(图1)。此外,作者实现了局部参考节点算法以减少内存占用,并改进了树搜索和分支长度优化。随后,利用模拟数据和真实Viridian共识基因组数据集对模型性能进行基准测试,并重建了包含2,072,111个基因组的全球SARS-CoV-2系统发育树。

图 1 Fig. 1。图1通过简单系统发育树示例说明如何区分突变和序列错误。根状态为C,衍生状态为T(绿色)。a:无突变无错误时,比对列只有一种核苷酸。b:真实突变在内部和末端枝上均匀分布。c:序列错误仅富集在末端枝。d:高错误概率导致末端枝上出现多个独立T。该图直观展示了模型利用内部/末端枝替换分布差异来估计速率和错误概率的原理。
核心亮点
亮点 1|位点特异性模型提升树推断准确性
在模拟数据上,加入速率变异和错误模型的MAPLE显著提高了系统发育树推断的准确性(图2c)。与仅使用UNREST模型相比,错误模型尤其减少了由反复序列错误导致的错误拓扑。模拟还显示,随着基因组数量增加,错误参数估计的精度和敏感性提高;在20万基因组时,单个序列错误的估计精度约92%,敏感性约83%。

图 2 Fig. 2。图2展示模拟数据上不同模型的性能比较。a和b显示GTR、UNREST、UNREST+RateVar和UNREST+Errors四种模型在时间(a)和内存(b)需求上的差异,错误模型增加的计算负担有限。c显示错误模型显著提高树拓扑准确性(归一化Robinson-Foulds距离更低)。d和e显示随基因组数量增加,错误概率估计的精度和敏感性提高,在20万基因组时达到约92%精度和83%敏感性。
亮点 2|识别并掩蔽反复错误位点
对299万Viridian共识基因组进行系统发育推断和错误估计后,作者识别出多个高错误概率位点,包括8835和15521等已知受ARTIC V4引物非特异性结合影响的位点。通过整合读取数据中的高频替代等位基因、IUPAC模糊字符和系统发育聚类等红旗信号,作者验证了这些位点的错误性质,并生成了掩蔽列表(Extended Data Table 2),用于后续可靠比对。

图 3 Fig. 3。图3展示从>200万Viridian基因组比对中估计的位点特异性错误概率和突变率。a:错误概率沿基因组分布,高错误位点(>0.00007)被标注,如8835和15521。b:位点特异性突变率的直方图,显示高度变异。c和d:展示中等错误频率位点的例子,可能由有害突变等其他因素导致。e:突变率最高的位点包括11083等,与已知高突变位点一致。
亮点 3|重建>200万基因组全球树
最终比对包含2,072,111个Viridian基因组,掩蔽了错误易发位点并过滤了低覆盖和杂合样本。使用MAPLE在UNREST+速率变异模型下推断系统发育树,初始树构建耗时约4天17小时,拓扑改进并行化耗时约5天13小时。推断的突变率最高位点包括11083等,与先前研究一致。

图 4 Fig. 4。图4比较MAPLE和cov2tree在Delta分支上的拓扑差异。左侧为MAPLE推断的全球树,中间放大显示AY谱系早期进化,右侧为cov2tree对应部分。MAPLE推断一个主要Delta分支由两个姐妹分支组成(含AY.13、AY.14等和AY.9、AY.47等),而cov2tree将第一个分支作为第二个分支的子分支。检查突变历史表明cov2tree拓扑为局部最优,重新附着可减少两个替换事件。
亮点 4|揭示Delta分支拓扑差异
与cov2tree比较显示,MAPLE推断的一个主要Delta分支由两个姐妹分支组成,而cov2tree将第一个分支作为第二个分支的子分支。检查cov2tree的突变历史发现,其拓扑代表局部最优;将第一个分支重新附着到类似MAPLE的位置可减少两个替换事件,表明MAPLE的SPR搜索能有效改进树拓扑。

图 5 Fig. 5。图5展示AY.43.3谱系的多起源。中间显示MAPLE推断大多数AY.43.3基因组属于一个由C19955T突变定义的支系,但右侧显示MAPLE推断一个较小的AY.43.3支系起源于独立的C19955T突变。MAPLE估计C19955T在树中发生了380次,远高于其他两个突变(C8502T 83次,A29723T 33次),因此将所有AY.43.3基因组聚为一个支系需要假设不太可能的突变历史。
亮点 5|发现AY.43.3谱系的多起源
MAPLE推断AY.43.3谱系基因组并非单系,而是由C19955T突变独立发生两次形成。该突变在整个树中发生了380次,而将AY.43.3聚为一个分支需要假设其他罕见突变,可能性较低。这一发现凸显了同源突变对谱系定义和分类的影响。
亮点 6|污染导致BA.1亚谱系多分支
在BA.1内部,MAPLE推断出多个BA.1.1和BA.1.15亚谱系分支,检查读取数据发现这些基因组在假定的重组位点具有低覆盖和杂合性,提示共识序列可能受污染或混合感染影响。尽管预处理已过滤大量样本,但少量污染基因组仍可能影响主要分支的进化历史推断。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: UNREST模型、位点特异性速率变异、位点特异性错误模型、EM算法、局部参考、SPR搜索
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/NicolaDM/MAPLE
- 谁该点开原文: 从事病原体基因组流行病学、系统发育推断和生物信息学方法开发的研究人员。
带走一句
处理大规模病原体基因组数据时,应同时建模位点突变率变异和序列错误,以减轻同源性对系统发育推断的干扰。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。