周启涛生物技术工作室
基因组与遗传2026/02/09· 编译自 Nature Methods

IF36.1|Viridian重装SARS-CoV-2基因组,修正全球系统错误

用单一amplicon-aware流程重处理全部公共数据,大幅减少系统错误,构建更可靠全球系统发育树。

用单一amplicon-aware流程重处理全部公共数据,大幅减少系统错误,构建更可靠全球系统发育树。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

SARS-CoV-2大流行期间,全球测序主要采用tiled amplicon方法,即通过重叠引物扩增基因组片段并拼接。然而,病毒持续进化导致引物结合位点突变,引起amplicon dropout,而许多组装软件在缺失数据时错误地填充参考序列,造成基因组中大量系统性错误,尤其是“回复突变”假象。这些错误与特定测序中心、时间及变异株相关,严重影响系统发育树推断和下游进化、流行病学分析。此前社区通过手动掩蔽问题位点和分支来缓解,但耗时且不彻底。

科学问题

卡在哪里: 此前缺乏统一的、amplicon-aware的组装流程,且公共数据中引物方案和组装管线元数据严重缺失,导致无法有效识别和纠正系统性错误。现有ARTIC工作流在Nanopore数据上indel错误较多,且未针对amplicon dropout进行专门处理。

本文要回答: 开发一个针对tiled amplicon数据的组装工具Viridian,重新处理所有公共SARS-CoV-2原始测序数据,生成高质量共识序列,并构建一个需要更少掩蔽的全球系统发育树。

技术路线

作者主要用了:Viridian组装、模拟数据、真实标准集、大规模重处理、系统发育树构建、PyR0生长率分析

作者开发了Viridian,一个amplicon-aware的组装工具,能自动识别引物方案,按amplicon分别组装并合并,最后通过重映射进行QC和掩蔽。他们首先用模拟数据和已知真相的真实数据集验证Viridian的性能,然后将其应用于非洲早期Omicron数据集和全部ENA/SRA公共数据(截至2024年6月),并与GenBank现有组装进行比较。通过统计回复突变数量、Pango谱系一致性、生长率估计不确定性等指标,量化Viridian对系统发育树质量的改进。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1通过卡通树和真实树展示amplicon dropout导致的错误填充参考序列如何产生虚假的回复突变。在Omicron分支中,位置22813(K417N)出现大量紫色(祖先型)叶子,这些叶子不聚集在特定亚支,提示是组装错误而非真实回复突变。

核心亮点

亮点 1|Viridian大幅减少组装错误

在非洲早期Omicron数据集(n=12,287)上,Viridian的总错误数仅为31-86个,而ARTIC工作流为219-2,148个,原始组装为1,069-10,909个。Viridian几乎完全消除了系统性位置错误,尤其在引物结合区域。模拟数据和真实标准集也显示Viridian在Nanopore数据上indel错误显著少于ARTIC-ONT(0 vs 54)。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2时间线总结了与测序和一致性调用相关的问题事件,包括引物二聚体、9-bp缺失、spike 95/142位点dropout、ARTIC v.4引入的假突变以及Omicron样本中的问题。绿色三角形标记ARTIC引物方案版本发布,显示问题随方案更新而波动。

亮点 2|全球树回复突变显著减少

比较Viridian和GenBank交集集(n=3,311,456)构建的树,Viridian树中具有大量回复突变的位置更少。例如,GenBank树有63个位置具有200次以上回复突变,而Viridian树只有20个。散点图显示几乎所有位置的回复突变数在Viridian树中都更低,表明Viridian树需要的掩蔽更少。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3在非洲早期Omicron数据集上比较Viridian、原始组装和ARTIC工作流的错误率。Viridian的错误率极低,几乎为零,而原始组装和ARTIC-ONT在特定区域(如引物结合区)有大量错误。总错误数和错误位点数均显示Viridian远优于其他方法。

亮点 3|生长率估计精度提高三倍

使用PyR0模型比较基于Viridian和GenBank树的谱系生长率估计,发现Viridian树使后验密度标准差平均降低超过三倍,尤其对B和BA衍生谱系改善最大。这表明更准确的基因组序列直接提升了流行病学参数估计的可靠性。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4比较Viridian和GenBank树中每个基因组位置的回复突变数量。Viridian曲线下降更快,表明具有大量回复突变的位置更少。散点图显示大多数位置在Viridian树中回复突变更少,只有少数位置(如22786、8835、15521)Viridian较高。

亮点 4|Pango谱系高度一致但更特异

在交集集中,Viridian与GenBank组装的Pango谱系分配一致性达99.02%,且Viridian分配更特异(60%的父子不一致中Viridian为子谱系)。没有Viridian组装被分配为“未指定”,而GenBank有87个。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示使用PyR0模型估计的谱系生长率不确定性差异。负值表示Viridian树的标准差更小。大多数谱系点位于零以下,表明Viridian树显著降低了生长率估计的不确定性,尤其对B和BA衍生谱系。

亮点 5|全球树包含447万样本

最终Viridian全球树包含4,471,579个样本,覆盖2020年1月至2024年6月。该树在构建时采用了先高质量样本后低质量样本、按时间排序的策略,避免了重组基因组对树结构的干扰。树已公开于https://viridian.taxonium.org。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: Viridian组装、模拟数据、真实标准集、大规模重处理、系统发育树构建、PyR0生长率分析
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 公开仓库 https://github.com/iqbal-lab-org/viridian、https://github.com/nebiolabs/VarSkip
  • 谁该点开原文: 从事病原体基因组学、系统发育学、流行病学建模以及大规模测序数据处理的生物信息学研究人员。

带走一句

对于大规模病原体基因组分析,统一使用amplicon-aware的组装流程并重新处理原始数据,可以显著减少系统错误,提高系统发育树和下游分析的可靠性。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。