IF46.9|DreaMS:自监督学习从百万级质谱中挖掘分子表征
不依赖标注库,直接从原始质谱中自监督学习分子结构表征,性能超越现有方法。
不依赖标注库,直接从原始质谱中自监督学习分子结构表征,性能超越现有方法。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
小分子代谢物的发现与鉴定是药物开发、环境分析和疾病诊断等领域的关键环节,但自然界中绝大多数小分子尚未被鉴定。液相色谱-串联质谱(LC-MS/MS)是分析生物与环境样本分子组成的主要技术,然而对非靶向代谢组学实验产生的串联质谱(MS/MS)进行结构解析仍极具挑战。传统方法依赖有限的谱图库和人工设计的规则,仅能注释不到10%的谱图。近年来,深度学习在质谱解析中展现出潜力,但受限于标注数据规模,模型性能难以突破。
科学问题
卡在哪里: 现有方法高度依赖标注谱图库和领域知识,而谱图库覆盖的分子结构仅占已知天然产物的一小部分,更遑论未知化学空间。缺乏大规模、标准化的质谱数据集,以及能够从海量未标注数据中自监督学习分子表征的模型,是当前的主要瓶颈。
本文要回答: 本文旨在构建一个大规模、高质量的实验质谱数据集,并开发一个基于Transformer的自监督模型,直接从数百万未标注的MS/MS谱图中学习分子结构表征,并验证其在多种下游任务中的泛化能力。
技术路线
作者主要用了:自监督学习、Transformer、掩码建模、保留顺序预测、对比微调、分子网络。
作者首先从MassIVE GNPS仓库挖掘了约7亿张MS/MS谱图,通过严格的质量控制和局部敏感哈希聚类,构建了GeMS数据集。随后设计了一个基于Transformer的DreaMS模型,采用掩码峰预测和色谱保留顺序预测两个自监督任务进行预训练。预训练后,通过对比微调增强嵌入对细微结构差异的敏感性,并针对谱图相似性、分子指纹预测、分子性质预测和氟检测等任务进行微调。最后,利用微调模型对2.01亿张谱图进行注释,构建了DreaMS Atlas分子网络。

图 1 Fig. 1。图1展示了LC-MS/MS产生大量MS/MS谱图但注释率极低(<10%)的现状,以及公共未注释谱图数量激增与标注谱图库覆盖分子结构有限之间的巨大差距,凸显了利用未标注数据自监督学习的必要性。
核心亮点
亮点 1|GeMS数据集:百万级质谱资源
作者从MassIVE GNPS仓库挖掘了约7亿张MS/MS谱图,通过文件级和谱图级质量控制,构建了三个不同质量等级的子集:GeMS-A(4200万)、GeMS-B(1亿)和GeMS-C(2.01亿)。进一步利用局部敏感哈希(LSH)聚类去冗余,得到九个变体。GeMS数据集比现有谱图库大几个数量级,且以适合深度学习的张量格式存储,为大规模自监督学习奠定了基础。

图 2 Fig. 2。图2详细描述了GeMS数据集的挖掘流程:从GNPS仓库收集实验、提取谱图、应用文件级和谱图级质量控制得到A/B/C三个子集,再通过LSH聚类去冗余,最终形成九个变体。热图显示了各变体的规模,表明GeMS比现有谱图库大几个数量级。
亮点 2|自监督预训练涌现分子结构表征
DreaMS在GeMS-A10上预训练,通过掩码30%的m/z峰并预测其离散化质量分布,以及预测同一实验中两张谱图的保留顺序,模型无需任何标注即可学习分子结构信息。线性探测显示,随着训练进行,模型逐渐发现MACCS指纹对应的分子子结构;注意力分析表明模型优先关注代表分子结构的峰;嵌入空间线性聚类了不同电离和碎裂条件下的相同分子。消融实验证实数据质量比规模更重要,且分类式掩码预测优于回归。

图 3 Fig. 3。图3展示了DreaMS的自监督学习框架:输入同一实验中的两张谱图及其前体m/z,掩码部分峰并训练模型重建质量分布,同时预测保留顺序。架构上采用Transformer编码器,结合质量容忍的傅里叶特征和Graphormer式注意力。线性探测显示训练过程中分子子结构逐渐涌现,注意力头聚焦于结构相关峰,嵌入空间线性聚类相同分子。
亮点 3|对比微调提升谱图相似性检索
零样本DreaMS嵌入的余弦相似度在预测前体Tanimoto相似度上已优于监督方法MS2DeepScore。通过精心设计的对比微调,使用MoNA中5500个分子的硬三元组(同分子不同谱为正,相似质量不同分子为负),模型对细微结构差异的敏感性显著增强。在10 ppm前体质量差内检索相同分子的任务中,微调DreaMS大幅超越44种标准谱图相似度算法,AUROC达到0.99以上,且对谱图质量更鲁棒。

图 4 Fig. 4。图4汇总了DreaMS在多个任务上的性能:零样本嵌入相似度已优于MS2DeepScore,对比微调后进一步提升;在谱图库检索和类似物搜索中大幅超越传统算法;指纹预测与MIST相当;分子性质预测全面领先;氟检测精确率远高于SIRIUS。UMAP可视化显示嵌入按化学式和结构基序组织。
亮点 4|多任务微调达到最先进水平
DreaMS在多个下游任务上表现优异:直接预测Morgan指纹并在PubChem中检索分子,性能与依赖峰公式标注的MIST相当;同时预测11种分子性质(如QED、合成可及性、Bertz复杂度),在所有性质上均超越MS2Prop和XGBoost;检测含氟分子时,在17,000张内部谱图上达到0.91的精确率和0.57的召回率,显著优于SIRIUS(精确率不超过0.51),且对训练集外结构差异大的分子仍能正确检测。

图 5 Fig. 5。图5展示了DreaMS嵌入在样本水平上的组织能力:对食品样本的MS/MS谱图嵌入取平均后,UMAP投影清晰地按食品类别(如饮料、乳制品、水果等)聚类,表明DreaMS能够捕捉完整代谢谱的组成信息,为跨样本代谢组比较提供了新工具。
亮点 5|DreaMS Atlas:2亿谱图的分子网络
利用微调模型对GeMS-C中2.01亿张谱图生成嵌入,构建了近似3近邻图,并合并高相似度节点,最终得到包含3400万节点的DreaMS Atlas。网络连通性极强,99.7%的节点属于同一连通分量,谱图库节点均匀分布其中。通过邻居传播,可从未注释谱图推断潜在分子,例如在银屑病样本中发现与杀菌剂嘧菌酯的关联,展示了该图谱在跨研究整合和未知化合物发现中的潜力。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 自监督学习、Transformer、掩码建模、保留顺序预测、对比微调、分子网络
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事代谢组学、质谱数据解析和深度学习模型开发的生信研究者与研究生。
带走一句
自监督学习可以从海量未标注质谱中提取分子结构表征,摆脱对标注谱图库的依赖,为代谢组学分析提供了可扩展的基础模型。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。