IF36.1|Spacedust:基于结构比对从头发现微生物保守基因簇
用Foldseek结构比对+统计检验,在1308个细菌基因组中找回95%的已知防御系统。
用Foldseek结构比对+统计检验,在1308个细菌基因组中找回95%的已知防御系统。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
宏基因组学极大推动了微生物生态和人体微生物组研究,但大量基因功能未知,限制了数据解读。原核生物和病毒中,参与同一生物过程的基因倾向于在基因组上成簇排列,因此基因邻域的保守性可以提示功能关联。传统方法多依赖序列相似性搜索或预定义的蛋白家族数据库,对远缘同源或未知家族的基因簇检测能力有限。已有一些工具针对特定类型基因簇(如生物合成基因簇、噬菌体防御系统)进行预测,但缺乏通用的、从头发现保守基因簇的方法。
科学问题
卡在哪里: 现有从头发现基因簇的方法多基于序列比对,灵敏度低,难以检测远缘保守的基因簇;且大多需要参考数据库或严格共线性,无法发现部分重排或未知家族的基因簇。此外,这些方法难以扩展到数百个基因组的全对全比较。
本文要回答: 开发一种快速、灵敏、无需参考数据库的工具,能够从头发现任意类型、部分保守的基因簇,并评估其在大规模细菌基因组分析中的表现。
技术路线
作者主要用了:Foldseek结构比对、MMseqs2序列搜索、聚类P值、排序P值、全对全比较。
Spacedust首先用Foldseek和MMseqs2对输入基因组的所有蛋白进行同源搜索,获得蛋白匹配。然后对每对基因组,利用贪心聚类算法检测保守基因簇:从单个匹配开始,逐步加入相邻匹配,若聚类P值和排序P值联合显著性提高则接受。聚类P值评估匹配在基因组窗口内聚集的显著性,排序P值评估基因顺序和方向保守的显著性。最后输出所有显著保守的基因簇。该方法允许部分共线性,并能扩展到上千个基因组的全对全比较。

图 1 Fig. 1。图1展示Spacedust工作流程:从蛋白同源搜索(Foldseek/MMseqs2)到聚类检测。b部分显示贪心聚类过程:从单基因簇开始,逐步合并同源蛋白对,直到聚类P值和排序P值联合显著性不再提高。彩色框表示Foldseek找到的同源蛋白对。
核心亮点
亮点 1|覆盖58%基因的保守簇图谱
对1308个代表不同属的细菌基因组进行全对全分析,共4.19百万个基因。Spacedust识别出72,843个非冗余保守基因簇,包含2.45百万个基因,占全部基因的58%。其中66%的已注释基因和35%的未注释基因被纳入保守簇。功能关联精度随保守基因组数增加而提高:在至少50个基因组中保守的基因对,共享KEGG模块的比例超过80%。

图 2 Fig. 2。图2a显示106.6百万个成对簇匹配的大小分布,平均每个簇约3个基因。b显示基因随保守基因组数增加的累积分布:58%的基因在至少一个簇中,35%的未注释基因也在簇中。c和e比较不同搜索模式下基因对功能关联精度随保守基因组数的变化,Foldseek-only模式略优于Foldseek+MMseqs2。
亮点 2|蓝细菌基因组功能注释示例
以集胞藻PCC 6803为例,Spacedust在300个基因的窗口内识别出3个蓝细菌特异簇和21个跨门保守簇。簇1包含光系统II相关基因(rubredoxin、ycf48、psbEFLJ),簇2为藻胆体杆组分(cpcA、cpcB等),簇3含丝氨酸/苏氨酸激酶spkA及一个未知功能基因。这些簇展示了Spacedust对已知功能模块的恢复能力和对未注释基因的提示作用。

图 3 Fig. 3。图3a展示集胞藻PCC 6803基因组500-800位点区域与1308个参考基因组的簇匹配热图,上方为存在/缺失热图,中间为转录方向,下方为每个蛋白的簇匹配数。b为蓝细菌特异簇1的基因邻域图,包含rubredoxin、ycf48和psbEFLJ,部分基因组中psbL和psbJ缺失。
亮点 3|恢复95%的抗病毒防御系统
与PADLOC预测的5,520个多基因防御系统簇相比,Spacedust恢复了95%(5,255个),其中93%完整匹配,7%部分匹配。部分匹配主要因短基因在长簇边缘缺失。在106种防御系统类型中,73种类型的完整恢复率超过90%。限制修饰II型系统数量最多但最难检测。

图 4 Fig. 4。图4a显示Spacedust对PADLOC预测的多基因防御系统簇的恢复比例:95%被恢复,其中93%完整匹配。b为具体数量:5,255个完整或部分匹配,265个未匹配。不同防御系统类型恢复率差异明显,限制修饰II型最难检测。
亮点 4|BGC检测优于专用工具
在9个完整注释的基因组上,Spacedust对207个生物合成基因簇(BGC)的平均F1分数为0.61,高于ClusterFinder(0.44)、DeepBGC(0.39)和GECCO(0.43)。Spacedust的优势在于高精度和高召回率的平衡,常覆盖核心生物合成基因但可能遗漏转运和调控基因。

图 5 Fig. 5。图5比较Spacedust与ClusterFinder、DeepBGC、GECCO在207个注释BGC上的F1分数。散点图显示Spacedust在多数BGC上F1更高,累积分布曲线显示其平均F1为0.61,显著优于其他工具。
亮点 5|扩展CRISPR-Cas III-E亚型
利用Spacedust的迭代搜索模式,在GTDB数据库中从已知17个Cas7-11位点出发,新发现7个III-E亚型系统实例,其中3个基因组中系统所有组分均被识别。这展示了Spacedust在已知基因簇家族扩展中的应用潜力。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: Foldseek结构比对、MMseqs2序列搜索、聚类P值、排序P值、全对全比较
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事微生物基因组、宏基因组功能注释或基因簇预测的生信研究人员。
带走一句
用结构比对代替纯序列比对,结合统计检验,可以大幅提升保守基因簇的发现灵敏度和规模,值得在宏基因组功能注释流程中尝试。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。