周启涛生物技术工作室
多组学与方法2026/03/24· 编译自 Nature Methods

IF36.1|DIAMOND DeepClust实现19亿蛋白序列深度聚类

新方法18天聚类19亿蛋白序列,速度比MMseqs2快36倍,并提升AlphaFold2预测。

新方法18天聚类19亿蛋白序列,速度比MMseqs2快36倍,并提升AlphaFold2预测。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

随着全球生物圈测序数据爆炸式增长,如何将数十亿蛋白序列按进化关系组织起来成为比较基因组学和AI结构预测的关键挑战。此前,AlphaFold2等突破性进展得益于大规模蛋白聚类数据库如BFD,但现有聚类工具如CD-HIT、UClust、MMseqs2/Linclust在扩展到数十亿序列时面临速度与灵敏度的权衡,难以满足地球生物基因组计划(Earth BioGenome Project)预计产生的约270亿条蛋白序列的聚类需求。

科学问题

卡在哪里: 现有聚类方法在处理数十亿蛋白序列时,要么速度过慢(如MMseqs2全对全比对需数周),要么灵敏度不足(如FLSHclust牺牲灵敏度换取速度),且多数工具受限于单节点内存和32位序列标识符,无法扩展到万亿级序列和分布式存储环境。

本文要回答: 开发一种可扩展至数十亿甚至万亿级蛋白序列的深度聚类方法,在保持高灵敏度的同时大幅提升速度,并验证其在蛋白结构预测等下游任务中的价值。

技术路线

作者主要用了:DIAMOND v.2、级联聚类、贪心顶点覆盖、minimizer采样、多节点并行

作者基于DIAMOND v.2比对器开发了DIAMOND DeepClust,采用级联聚类策略:先用线性模式快速预聚类,再通过多轮全对全比对逐步提高灵敏度。第一轮使用minimizer采样和线性阶段算法,后续轮次使用贪心顶点覆盖算法选取代表序列,并通过双向覆盖准则优化聚类质量。该方法支持多节点并行和分布式存储,可处理万亿级序列。基准测试在NCBI NR数据库(约5.46亿序列)上进行,与MMseqs2和FLSHclust比较速度、灵敏度和精度。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了对NCBI NR数据库(约5.46亿序列)进行深度聚类的基准测试结果。a图显示各工具在64核服务器上的运行时间(天),DIAMOND DeepClust仅需0.8天,而MMseqs2需29天,FLSHclust需17天。b图聚焦运行时间小于1天的工具,以小时为单位,DIAMOND DeepClust为19小时,线性模式仅3.9小时。c图展示灵敏度和精度的分布,DIAMOND DeepClust在灵敏度68.6%和精度95.5%处取得最佳平衡,优于MMseqs2和FLSHclust。

核心亮点

亮点 1|19亿序列18天完成聚类

作者收集了约22亿条公开蛋白序列,去重后得到约19.4亿条,使用DIAMOND DeepClust在27个计算节点上以30%序列一致性和90%单向覆盖阈值进行聚类,总耗时18天(约25万CPU小时),得到约17亿个簇,其中32%为非单例簇,68%为单例簇。单例簇虽占簇数多数,但仅包含6%的序列,说明深度聚类可有效压缩蛋白空间。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2显示从19亿序列数据集中随机抽取的100万个代表序列(来自大小≥3的簇)在不同数据库中的注释覆盖率。横轴为序列覆盖阈值,纵轴为可注释的代表序列比例。随着覆盖阈值提高,可注释比例下降。在60%覆盖阈值下,64.7%的代表序列可被BFD覆盖,而其他数据库如UniProtKB/TrEMBL、MGnify、Pfam、CATH、ECOD、SCOPe的覆盖率更低。这表明新数据库包含大量BFD未覆盖的新序列。

亮点 2|速度比MMseqs2快36倍

在NCBI NR数据库(约5.46亿序列)上使用双向覆盖且无序列一致性阈值进行深度聚类,DIAMOND DeepClust在64核服务器上仅用19小时完成,而MMseqs2需要29天,速度提升36倍。同时,DIAMOND DeepClust的灵敏度为68.6%,高于MMseqs2的62.3%,精度均为95.5%。与FLSHclust相比,DIAMOND DeepClust快21倍,灵敏度高18.9个百分点。

亮点 3|线性模式102倍快于FLSHclust

DIAMOND DeepClust的线性模式在NR数据库上仅运行3.9小时,比FLSHclust快102倍,灵敏度为53.8%(FLSHclust为49.7%),精度95.9%(FLSHclust为96.5%)。MMseqs2/Linclust虽然最快(2.8小时),但灵敏度仅21.6%,远低于其他工具。此外,DIAMOND DeepClust线性模式支持多节点并行,在32个节点上可将22亿序列的聚类时间从单节点的15.3小时缩短至35分钟,展现出近线性扩展能力。

亮点 4|新增1.18亿蛋白家族

与AlphaFold2使用的BFD数据库相比,DIAMOND DeepClust数据库包含3.35亿个至少含3个成员的簇,是BFD的5.5倍。通过HHblits比对,估计有1.18亿个蛋白家族是新的,无法映射到BFD。在100万个代表序列的样本中,64.7%的代表序列至少60%的序列范围可被BFD序列覆盖,表明新数据库大幅扩展了蛋白序列多样性。

亮点 5|提升AlphaFold2预测精度

作者从DIAMOND DeepClust数据库中选取473个在BFD和MGnify中MSA深度不足30的序列,使用新数据库进行AlphaFold2结构预测。结果显示,366个序列的pLDDT分数提高,107个降低,平均pLDDT从52.9提升至62.6,提升7.73。Wilcoxon秩和检验P<2.2×10^-16,表明提升显著。这证明大规模深度聚类数据库能有效改善低同源序列的结构预测。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: DIAMOND v.2、级联聚类、贪心顶点覆盖、minimizer采样、多节点并行
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事大规模比较基因组学、宏基因组学、蛋白结构预测或生物信息学工具开发的研究者。

带走一句

DIAMOND DeepClust为大规模蛋白聚类提供了可扩展且高灵敏的解决方案,其线性模式支持多节点并行,能处理万亿级序列,可作为AlphaFold2等结构预测工具的上游数据库构建手段。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。