IF36.1|Foldseek-Multimer:蛋白复合物结构比对加速3-4个数量级
用叠加向量聚类替代链配对穷举,11小时完成570亿对复合物全对全搜索。
用叠加向量聚类替代链配对穷举,11小时完成570亿对复合物全对全搜索。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
蛋白复合物结构比对是理解四级结构多样性、同源关系及功能的基础。随着AlphaFold-Multimer等预测工具普及,数据库中的复合物结构数量将激增至百万级。现有金标准US-align通过TM-score最大化进行比对,但链配对组合数呈阶乘增长,导致计算成本极高。QSalign虽通过序列预筛加速,但灵敏度受限,且对约10万复合物的全对全搜索仍需数月。基于3D Zernike描述符的方法速度极快,但只能发现整体形状相似的全局匹配,无法识别局部或低序列相似性结构。因此,亟需一种兼具高灵敏度和高速度的大规模复合物结构比对方法。
科学问题
卡在哪里: US-align等精确比对方法因阶乘级链配对搜索而极慢,无法扩展到百万级数据库;QSalign依赖序列预筛,丢失了低序列相似性(twilight zone)下的结构相似性;形状描述符方法则牺牲了局部匹配能力。
本文要回答: 开发一种快速且灵敏的蛋白复合物结构比对算法,能够处理数十亿对复合物的全对全比较,同时保持与金标准US-align相当的比对质量。
技术路线
作者主要用了:Foldseek链比对、叠加向量聚类、DBSCAN、聚类数据库搜索。
Foldseek-Multimer首先用Foldseek对查询和目标复合物的所有链对进行快速比对,得到链间叠加向量(旋转和平移)。由于正确的复合物比对要求所有链对共享同一叠加向量,作者将叠加向量视为点,用DBSCAN聚类找出兼容的链对集合,从而确定复合物比对。该方法避免了阶乘级链配对搜索,并利用聚类数据库(如PDB100)先搜索代表序列再扩展,进一步加速。

图 1 Fig. 1。图1展示了Foldseek-Multimer的核心流程:查询复合物与数据库目标的所有链对先经Foldseek快速比对,得到叠加向量;通过DBSCAN聚类叠加向量识别兼容的链对集合,从而确定复合物比对。该图强调用叠加向量聚类替代传统阶乘级链配对搜索,是速度提升的关键。
核心亮点
亮点 1|比对质量与US-align高度一致
在931对已知结构相似的复合物基准上,Foldseek-Multimer的两种模式(3Di+AA和TM-align)均检测到超过95%的相似对(US-align为97.6%),TM-score与US-align高度相关(Pearson's r高),且在>99%的情况下产生相同的链配对。这表明其比对质量接近金标准。

图 2 Fig. 2。图2a显示Foldseek-Multimer与US-align在931对复合物上的TM-score高度相关;图2b显示在数据库搜索时Foldseek-Multimer比US-align快3-4个数量级,且随链数增加优势更明显;图2c展示CRISPR-Cas查询的PDB100搜索结果,Foldseek-MM找到的5个命中均为IV-A型系统;图2d显示全对全搜索中Foldseek-MM额外发现170万对同源复合物。
亮点 2|速度提升3-4个数量级
在数据库搜索场景下,Foldseek-Multimer比US-align快3-4个数量级。例如,对一个含6条链、1843个氨基酸的CRISPR-Cas复合物查询PDB100(426,347条目),Foldseek-MM仅需27秒,Foldseek-MM-TM需6分钟,而US-align需13天。加速来自链间比对的Foldseek效率、叠加聚类替代全局比对,以及聚类数据库的预筛。
亮点 3|发现低序列相似性的CRISPR-Cas同源物
对Sulfitobacter sp. JL08的IV-A型CRISPR-Cas复合物进行PDB100搜索,Foldseek-Multimer找到了5个TM-score>0.65的命中,均为Pseudomonas aeruginosa的IV-A型系统,尽管序列一致性仅11.1-19.8%。这验证了该环境样本中系统的类型归属,并展示了在远缘生物中识别结构同源物的能力。
亮点 4|全对全搜索揭示170万新同源复合物对
在3DComplexV7数据库(238,965个复合物)上,Foldseek-MM用128核在11小时内完成57亿对全对全比较,识别出98.6%的QSalign已发现同源对,并额外发现约170万对新的相似同源复合物。随机抽样10%经US-align验证,98.2%被确认,表明新发现对中超过160万对为真阳性。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: Foldseek链比对、叠加向量聚类、DBSCAN、聚类数据库搜索
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/steineggerlab/foldseek
- 谁该点开原文: 从事结构生物信息学、蛋白质复合物预测与功能注释的研究者,以及需要处理大规模结构数据库的分析人员。
带走一句
做大规模复合物结构比较时,用Foldseek-Multimer替代US-align,可在保持灵敏度的同时将计算时间从数天缩短到秒级。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。