IF36.1|PTM-Mamba:首个感知翻译后修饰的蛋白质语言模型
用双向Mamba块和门控融合,让蛋白质语言模型首次显式建模PTM,提升疾病关联、可成药性和PTM效应预测。
用双向Mamba块和门控融合,让蛋白质语言模型首次显式建模PTM,提升疾病关联、可成药性和PTM效应预测。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
蛋白质翻译后修饰(PTM)如磷酸化、乙酰化、泛素化和糖基化,极大扩展了真核生物蛋白质组的功能多样性,影响酶活性、蛋白质周转、信号级联和DNA修复等关键过程。PTM失调常导致癌症、神经退行性疾病和衰老等严重疾病。例如,STAT3特定位点的磷酸化可使其从普通转录因子转变为多种癌症中驱动肿瘤发生和转移的因子。蛋白质语言模型(如ESM-2、ProtT5)已成为编码蛋白质序列中理化与功能信息的变革性工具,但现有模型在训练和推理中完全排除了PTM残基,限制了其对PTM特异性效应的建模能力。
科学问题
卡在哪里: 现有蛋白质语言模型仅使用野生型氨基酸序列,无法表示PTM残基,因此不能捕捉PTM引起的结构、功能和相互作用变化,也无法直接用于PTM相关的下游任务,如疾病关联预测、可成药性评估和PTM对蛋白质-蛋白质相互作用的影响。
本文要回答: 开发一个能够同时建模野生型和PTM序列的蛋白质语言模型,并验证其在PTM相关下游任务中的性能。
技术路线
作者主要用了:双向Mamba块、门控嵌入融合、ESM-2-650M、掩码语言建模、t-SNE、零样本PTM发现。
作者从Swiss-Prot收集311,350条实验验证的PTM记录,映射到蛋白质序列构建79,707条PTM序列训练集。模型以ESM-2-650M为基础,野生型氨基酸输入ESM-2获取嵌入,PTM位点替换为<mask>;PTM-Mamba使用双向Mamba块处理完整序列(含PTM token),并通过门控机制融合ESM-2嵌入与PTM-Mamba嵌入。训练采用调整的掩码语言建模任务:80%概率标准15%掩码,20%概率掩码所有PTM token并随机掩码15%野生型token。随后在疾病关联、可成药性、PTM对PPI影响三个基准任务上评估,并展示零样本PTM发现能力。

图 1 Fig. 1。图1展示了PTM-Mamba的架构和嵌入可视化。a部分显示模型组件:输入序列以80%概率进行标准15% token掩码,20%概率掩码所有PTM token并随机掩码15%野生型token;双向Mamba块由前向和后向Mamba块组成,处理两个方向的序列;门控嵌入融合模块通过sigmoid激活的线性层融合ESM-2和PTM嵌入。b部分t-SNE图显示野生型序列与其PTM修饰对应物在嵌入空间中接近但可区分。c部分显示PTM残基token嵌入按类别聚集,且比野生型token更具多样性。
核心亮点
亮点 1|嵌入空间区分野生型与PTM序列
t-SNE可视化显示,PTM-Mamba的嵌入能够区分野生型蛋白质序列与其PTM修饰对应物,同时保持每对野生型序列的嵌入彼此接近,表明模型捕捉到PTM的细微但显著效应,同时保留蛋白质序列的上下文完整性。此外,PTM残基的token嵌入呈现类别特异性组织,磷酸化和乙酰化token在空间中邻近,且PTM残基token比野生型token具有更大的空间多样性,反映模型专注于编码PTM特异性信息。

图 2 Fig. 2。图2展示了PTM-Mamba在三个下游任务上的性能。a部分疾病关联预测中,PTM-Mamba在准确率、精确率、召回率、F1、MCC、AUPRC和AUROC上均优于基线。b部分可成药性预测中,PTM-Mamba在多数指标上领先。c部分PTM对PPI影响的预测中,PTM-Mamba取得最高指标。d部分零样本PTM发现示例,展示模型对特定残基预测的logits,正确识别出磷酸丝氨酸和S-二酰甘油半胱氨酸等PTM类型。
亮点 2|PTM-Mamba在PTM相关下游任务中表现优异
在疾病关联预测中,PTM-Mamba显著优于基线模型(包括ESM-2-650M和PTM-Transformer),能够捕捉PTM特异性效应以识别疾病相关蛋白。在可成药性预测中,PTM-Mamba在F1分数和MCC等关键指标上经常超过基线。在PTM对蛋白质-蛋白质相互作用影响的预测中,PTM-Mamba在所有模型中取得最高指标,甚至超过使用结构感知SaProt嵌入的PTM-SaProt,表明序列聚焦模型可能更优地捕捉PTM效应。所有基准测试均进行5次重复,报告平均值。
亮点 3|零样本PTM发现能力
通过分析野生型序列中掩码位置的模型logits,PTM-Mamba能够准确预测特定残基的合理PTM类型,例如对UniProt序列Q02261中的丝氨酸预测为<phosphoserine>,对UniProt序列Q4L7X2中的半胱氨酸预测为<S-diacylglycerol cysteine>。这一能力使PTM-Mamba成为生物学家无需额外训练或标签即可生成PTM生物学新见解的工具。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 双向Mamba块、门控嵌入融合、ESM-2-650M、掩码语言建模、t-SNE、零样本PTM发现
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/programmablebio/ptm-mamba
- 谁该点开原文: 从事蛋白质语言模型、PTM功能研究或计算蛋白质设计的生信研究者。
带走一句
将PTM作为显式token融入蛋白质语言模型,并采用双向Mamba和门控融合,能有效提升PTM相关任务的性能,为PTM感知的蛋白质建模和设计提供了新范式。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。