IF36.1|Viridian重装SARS-CoV-2基因组,修正全球系统错误
用单一amplicon-aware流程重处理全部公共数据,大幅减少系统错误,构建更可靠全球系统发育树。
用单一amplicon-aware流程重处理全部公共数据,大幅减少系统错误,构建更可靠全球系统发育树。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
SARS-CoV-2大流行期间,全球测序主要采用tiled amplicon方法,即通过重叠引物扩增基因组片段并拼接。然而,病毒持续进化导致引物结合位点突变,引起amplicon dropout,而许多组装软件在缺失数据时错误地填充参考序列,造成基因组中大量系统性错误,尤其是“回复突变”假象。这些错误与特定测序中心、时间及变异株相关,严重影响系统发育树推断和下游进化、流行病学分析。此前社区通过手动掩蔽问题位点和分支来缓解,但耗时且不彻底。
科学问题
卡在哪里: 此前缺乏统一的、amplicon-aware的组装流程,且公共数据中引物方案和组装管线元数据严重缺失,导致无法有效识别和纠正系统性错误。现有ARTIC工作流在Nanopore数据上indel错误较多,且未针对amplicon dropout进行专门处理。
本文要回答: 开发一个针对tiled amplicon数据的组装工具Viridian,重新处理所有公共SARS-CoV-2原始测序数据,生成高质量共识序列,并构建一个需要更少掩蔽的全球系统发育树。
技术路线
作者主要用了:Viridian组装、模拟数据、真实标准集、大规模重处理、系统发育树构建、PyR0生长率分析。
作者开发了Viridian,一个amplicon-aware的组装工具,能自动识别引物方案,按amplicon分别组装并合并,最后通过重映射进行QC和掩蔽。他们首先用模拟数据和已知真相的真实数据集验证Viridian的性能,然后将其应用于非洲早期Omicron数据集和全部ENA/SRA公共数据(截至2024年6月),并与GenBank现有组装进行比较。通过统计回复突变数量、Pango谱系一致性、生长率估计不确定性等指标,量化Viridian对系统发育树质量的改进。

图 1 Fig. 1。图1通过卡通树和真实树展示amplicon dropout导致的错误填充参考序列如何产生虚假的回复突变。在Omicron分支中,位置22813(K417N)出现大量紫色(祖先型)叶子,这些叶子不聚集在特定亚支,提示是组装错误而非真实回复突变。
核心亮点
亮点 1|Viridian大幅减少组装错误
在非洲早期Omicron数据集(n=12,287)上,Viridian的总错误数仅为31-86个,而ARTIC工作流为219-2,148个,原始组装为1,069-10,909个。Viridian几乎完全消除了系统性位置错误,尤其在引物结合区域。模拟数据和真实标准集也显示Viridian在Nanopore数据上indel错误显著少于ARTIC-ONT(0 vs 54)。

图 2 Fig. 2。图2时间线总结了与测序和一致性调用相关的问题事件,包括引物二聚体、9-bp缺失、spike 95/142位点dropout、ARTIC v.4引入的假突变以及Omicron样本中的问题。绿色三角形标记ARTIC引物方案版本发布,显示问题随方案更新而波动。
亮点 2|全球树回复突变显著减少
比较Viridian和GenBank交集集(n=3,311,456)构建的树,Viridian树中具有大量回复突变的位置更少。例如,GenBank树有63个位置具有200次以上回复突变,而Viridian树只有20个。散点图显示几乎所有位置的回复突变数在Viridian树中都更低,表明Viridian树需要的掩蔽更少。

图 3 Fig. 3。图3在非洲早期Omicron数据集上比较Viridian、原始组装和ARTIC工作流的错误率。Viridian的错误率极低,几乎为零,而原始组装和ARTIC-ONT在特定区域(如引物结合区)有大量错误。总错误数和错误位点数均显示Viridian远优于其他方法。
亮点 3|生长率估计精度提高三倍
使用PyR0模型比较基于Viridian和GenBank树的谱系生长率估计,发现Viridian树使后验密度标准差平均降低超过三倍,尤其对B和BA衍生谱系改善最大。这表明更准确的基因组序列直接提升了流行病学参数估计的可靠性。

图 4 Fig. 4。图4比较Viridian和GenBank树中每个基因组位置的回复突变数量。Viridian曲线下降更快,表明具有大量回复突变的位置更少。散点图显示大多数位置在Viridian树中回复突变更少,只有少数位置(如22786、8835、15521)Viridian较高。
亮点 4|Pango谱系高度一致但更特异
在交集集中,Viridian与GenBank组装的Pango谱系分配一致性达99.02%,且Viridian分配更特异(60%的父子不一致中Viridian为子谱系)。没有Viridian组装被分配为“未指定”,而GenBank有87个。

图 5 Fig. 5。图5展示使用PyR0模型估计的谱系生长率不确定性差异。负值表示Viridian树的标准差更小。大多数谱系点位于零以下,表明Viridian树显著降低了生长率估计的不确定性,尤其对B和BA衍生谱系。
亮点 5|全球树包含447万样本
最终Viridian全球树包含4,471,579个样本,覆盖2020年1月至2024年6月。该树在构建时采用了先高质量样本后低质量样本、按时间排序的策略,避免了重组基因组对树结构的干扰。树已公开于https://viridian.taxonium.org。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: Viridian组装、模拟数据、真实标准集、大规模重处理、系统发育树构建、PyR0生长率分析
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/iqbal-lab-org/viridian、https://github.com/nebiolabs/VarSkip
- 谁该点开原文: 从事病原体基因组学、系统发育学、流行病学建模以及大规模测序数据处理的生物信息学研究人员。
带走一句
对于大规模病原体基因组分析,统一使用amplicon-aware的组装流程并重新处理原始数据,可以显著减少系统错误,提高系统发育树和下游分析的可靠性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。