周启涛生物技术工作室
微生物组与感染2025/03/05· 编译自 Nature

IF50.5|相同序列揭示SARS-CoV-2精细传播模式

用11万条基因组证明:相同序列的空间聚类能还原人群接触与移动模式。

用11万条基因组证明:相同序列的空间聚类能还原人群接触与移动模式。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

病原体基因组数据已成为推断传染病传播链的重要工具。传统系统发育地理学方法通过构建进化树来追踪病毒在不同地区或人群间的扩散,但面对COVID-19大流行期间产生的数百万条基因组,这类方法计算成本过高,且对采样不均高度敏感。理论上,传播链上距离越近的个体,其感染的病毒基因组越相似,尤其是完全相同的共有序列,往往对应着流行病学上紧密关联的传播事件。因此,相同序列在人群中的聚类模式可能直接反映潜在的传播网络,但此前缺乏一个可扩展的统计框架来从大规模基因组数据中系统提取这一信号。

科学问题

卡在哪里: 现有系统发育地理学方法难以扩展到数千条以上序列,且在不均匀采样下会产生严重偏差。相同序列虽被认为携带传播信息,但如何将其转化为可解释的人群水平传播度量,并验证其与真实流动、接触数据的一致性,仍是空白。

本文要回答: 开发一个基于相同序列对的相对风险框架,用于从大规模病原体基因组数据中推断精细时空传播模式,并验证其与人类移动和社交接触数据的一致性。

技术路线

作者主要用了:相同序列聚类、相对风险框架、GAM、MDS、移动数据关联分析

作者首先从华盛顿州114,298条SARS-CoV-2基因组中识别出59,660条具有相同序列的样本,构建了17,231个相同序列簇。随后定义了一个相对风险(RR)指标,衡量两个亚群(如县或年龄组)之间相同序列对的富集程度,并利用重抽样策略计算置信区间。该指标无需构建系统发育树,计算效率极高。作者通过模拟数据验证了RR框架在异质性采样下仍能准确恢复迁移概率,而传统DTA方法则严重失真。最后,将遗传RR与手机移动数据、通勤数据和社交接触矩阵进行GAM回归,量化遗传信号对真实流动模式的解释力,并识别异常值以发现隐藏传播网络。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了相同序列如何反映传播模式。a部分示意相同序列簇在不同人群组间的分布可揭示传播连接;b部分显示在给定传播代数下,两个个体感染病毒遗传距离为0的概率约64%,说明相同序列对高度富集于直接传播对。c部分显示华盛顿州识别出17,231个相同序列簇,涉及59,660条序列。d部分展示一个大型簇的时空扩散过程,先局部后广泛。e部分显示簇半径随时间增长但低于随机预期。f部分示意RR计算逻辑。g部分显示同一县内相同序列RR中位数为4.7,随遗传距离增加衰减至1。

核心亮点

亮点 1|相同序列的空间聚类反映传播

相同序列簇的半径随时间增长,但显著低于随机预期;簇保持在首次发现县内的概率也显著高于随机。全州范围内,同一县内相同序列的RR中位数为4.7(IQR 2.4–21.2),随着遗传距离增加,该信号衰减至1。这表明相同序列对具有强烈的局部传播信号。模拟显示,RR框架在采样偏差下仍能准确估计迁移率,而DTA的估计值与真实迁移率的Pearson相关系数从0.54降至0.10(无偏采样)或从-0.22升至0.15(有偏采样)。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2聚焦县间传播模式。a部分以Stevens县为例展示与其他县相同序列RR的分布,显示地理邻近性。b部分显示相同序列RR在同一县最高、相邻县次之、非相邻县最低。c部分显示RR随地理距离衰减,超过177 km不再显著。d部分MDS排序将县分为WWA和EWA两大区域,与Cascades山脉分隔一致。e部分显示区域内相邻县RR显著,但跨EWA-WWA边界无此效应。f部分显示EWA内距离效应比WWA更强。g部分显示跨Cascades的相同序列对更常在WWA先被采集,提示传播方向从WWA到EWA。

亮点 2|移动数据解释60%的遗传变异

县水平上,手机移动数据衍生的RR可解释相同序列RR的60%方差;聚合到9个区域后,解释力提升至81%。通勤数据与手机数据高度相关,解释力相当。GAM残差分析发现Franklin–Mason和Walla Walla–Mason两对非相邻县存在异常高的相同序列RR,远超移动数据预期。进一步定位到这些县内的男性州立监狱所在邮编,发现监狱间存在大量相同序列共享,且华盛顿惩教中心(Mason县)在网络中具有最高特征向量中心性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3将遗传信号与移动数据关联。a部分显示县间相同序列RR与手机移动RR的GAM拟合,解释60%方差。b部分显示Franklin–Mason和Walla Walla–Mason为显著异常值,遗传RR远高于移动预期。c部分地图显示这三个县均有男性州立监狱。d和e部分显示异常信号主要来自监狱所在邮编之间的相同序列共享。f部分网络中心性分析显示华盛顿惩教中心所在邮编具有最高特征向量中心性。g部分展示多个大型相同序列簇在监狱邮编间的传播时间线,最大簇包含71条序列,其中67条来自监狱邮编。

亮点 3|年龄混合模式随空间尺度变化

相同序列的年龄组RR与合成社交接触矩阵高度相关(GAM解释90%方差,Spearman ρ=0.86)。当仅考虑不同县或不同邮编的序列对时,老年组(80+)的同龄富集从1.80降至0.79,表明老年人传播多发生在住所附近。儿童(0-9岁)与30-49岁成人之间的传播信号在跨县尺度上大幅减弱,提示这些接触主要发生在家庭内部。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4分析年龄组传播模式。a部分显示相同序列年龄组RR与社交接触RR高度相关(GAM解释90%方差)。b部分显示0-9岁组与其他年龄组的RR在不同空间尺度下变化,跨县时信号减弱。c部分显示仅考虑不同县序列对时,儿童与30-49岁成人间的传播信号大幅下降。d部分展示各年龄组在相同序列对中先被采集的比例,揭示不同流行波中年龄组作为传染源的差异。

亮点 4|序列采集时序揭示传播方向

在Alpha和Delta流行期间,20-29岁和40-59岁年龄组的相同序列对中更早被采集,提示这些组是主要传染源;Omicron期间10-19岁组最早出现。0-9岁儿童在Alpha/Delta期间可能是老年人的传染源,但在Omicron期间则相反。使用症状出现日期进行敏感性分析得到一致结论,表明结果不受检测行为差异影响。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 相同序列聚类、相对风险框架、GAM、MDS、移动数据关联分析
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事病原体基因组流行病学、系统发育地理学或传染病建模的研究者。

带走一句

放弃建树,直接数相同序列对,就能用极低计算成本从大规模基因组中提取传播模式,且对采样偏差稳健。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。