周启涛生物技术工作室
结构与蛋白质组2025/09/11· 编译自 Nature Methods

IF36.1|基于生物物理模拟的蛋白质语言模型METL

用Rosetta模拟数据预训练蛋白质语言模型,再结合少量实验数据微调,在低数据量和外推任务中表现优异。

用Rosetta模拟数据预训练蛋白质语言模型,再结合少量实验数据微调,在低数据量和外推任务中表现优异。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

蛋白质语言模型(PLMs)通过在海量天然序列上自监督学习,能够捕捉序列、结构与功能之间的复杂关系,已成为蛋白质工程中的有力工具。然而,这类模型主要依赖进化信息,忽视了近一个世纪积累的蛋白质生物物理学知识。生物物理模拟(如Rosetta)可以精确计算序列变异对结构、能量和稳定性的影响,但传统上很少与深度学习模型深度融合。已有方法或直接使用生物物理特征作为输入,或单独训练进化模型,缺乏一个统一框架将生物物理先验与实验数据有机结合。

科学问题

卡在哪里: 现有PLMs在低数据量(low-N)和外推任务(如位置外推、突变外推)中表现不佳,因为它们缺乏对蛋白质物理机制的显式建模。同时,纯生物物理方法(如Rosetta能量项)虽然可解释性强,但预测精度有限,且无法直接利用实验数据。如何将生物物理模拟的大规模合成数据与少量实验数据有效结合,提升模型在蛋白质工程中的泛化能力,仍是一个未解决的问题。

本文要回答: 本文提出METL框架,通过在大规模生物物理模拟数据上预训练Transformer,再在实验序列-功能数据上微调,以提升模型在低数据量和外推任务中的预测性能,并验证其在真实蛋白质设计中的可行性。

技术路线

作者主要用了:Rosetta模拟、Transformer预训练、微调、低N学习、外推评估、GFP实验验证

作者首先利用Rosetta对目标蛋白或一组多样蛋白生成数百万个序列变异体,计算55个生物物理属性(如溶剂可及表面积、范德华力、氢键等)。然后,用这些合成数据预训练一个基于Transformer的编码器,并引入基于3D结构的相对位置编码,使模型关注空间邻近的残基。预训练完成后,将模型在少量实验序列-功能数据上进行微调,预测如结合力、酶活性、热稳定性等性质。作者设计了两种预训练策略:METL-Local针对单一蛋白,METL-Global覆盖148个不同蛋白。通过系统评估学习曲线和四种外推任务,并与多种基线方法比较,验证METL的优势。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了METL的整体框架:a部分说明METL结合稀疏实验数据与密集生物物理模拟数据;b部分展示预训练流程,即用Rosetta生成数百万变体并计算属性,然后预训练PLM,再在实验数据上微调;c部分为METL的Transformer架构,包含基于结构的相对位置编码;d部分区分METL-Local和METL-Global两种预训练策略。该图清晰概括了从模拟到预测的完整流程。

核心亮点

亮点 1|METL-Local在低数据量下优于通用模型

在11个实验数据集上,METL-Local与Linear-EVE、ProteinNPT等蛋白特异性模型在小训练集(如8-64个样本)上表现最佳,而通用模型METL-Global和ESM-2则相对较弱。例如,在GFP和GB1数据集上,METL-Local的Spearman相关系数显著高于其他方法。随着训练数据增加,METL-Local的优势逐渐减弱,表明其生物物理先验在低数据场景下尤为关键。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2显示了11个数据集上的学习曲线,横轴为训练集大小(8到16,384),纵轴为测试集Spearman相关系数。METL-Local、Linear-EVE和ProteinNPT在小训练集上表现最佳,而METL-Global和ESM-2在数据量增大后逐渐追赶。平均曲线表明METL-Local在低数据量下具有明显优势,但随着数据增加,各方法差距缩小。

亮点 2|METL-Local在位置外推中表现突出

在四种外推任务中,位置外推最具挑战性,要求模型预测训练集中未出现突变位点的效应。METL-Local的平均Spearman相关系数达到0.59,仅次于ProteinNPT的0.65,远高于METL-Global和ESM-2。这归因于METL-Local的预训练数据包含了所有位置的所有可能单点突变,为模型提供了全面的局部景观先验。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3比较了各方法在四种外推任务上的表现:a为突变外推,b为位置外推,c为regime外推,d为score外推。METL-Local在位置外推中表现突出,在score外推中与METL-Global在GB1数据集上均超过0.7。整体上,监督学习方法在regime外推中表现良好,而score外推对所有方法都极具挑战。

亮点 3|模拟数据可部分替代实验数据

通过改变GB1模型的模拟预训练数据量和实验微调数据量,作者发现增加模拟数据可显著提升性能,且存在等效关系:约29个模拟数据点相当于1个实验数据点。例如,预训练1000个模拟数据+微调320个实验数据的模型,与预训练8000个模拟数据+微调80个实验数据的模型性能相当。这表明在实验数据稀缺时,大规模模拟数据能有效补偿。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4通过等高线图展示了GB1模型在不同模拟数据量和实验数据量组合下的测试集Spearman相关系数。结果显示增加任一数据源都能提升性能,且存在等效关系(如1000模拟+320实验 ≈ 8000模拟+80实验)。模拟数据在约128,000例后收益递减,表明实际应用中可使用较少模拟数据。

亮点 4|预训练模型捕获结构信息与上位效应

对预训练后未微调的GB1 METL-Local模型分析显示,其注意力图与残基距离矩阵高度相似,且残基表示按相对溶剂可及性聚类。此外,模型能识别已知的上位相互作用位点(如β1-β2环区的7、9、11位点),并正确预测G41L/V54G双突变的负上位效应。这证明生物物理预训练使模型在未见实验数据前就已具备结构感知能力。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了METL-Bind与METL-Local在GB1数据集上的对比:a为预训练数据差异(METL-Bind额外使用GB1-IgG复合物结合分数);b和c分别为学习曲线和外推性能,显示METL-Bind在低数据量下优于METL-Local;d和e为逐位点预测误差,METL-Bind在结合界面残基(如E27)上改善明显。

亮点 5|功能特异性模拟进一步提升性能

针对GB1与IgG的结合实验,作者在标准生物物理属性基础上增加了17个结合相关能量项,预训练得到METL-Bind。在低数据量微调后,METL-Bind在GB1数据集上的表现优于标准METL-Local,尤其在结合界面残基(如E27)的预测上改善显著。这表明将功能相关的模拟数据纳入预训练可以增强模型对特定功能的先验知识。

亮点 6|METL-Local仅用64个样本设计出功能性GFP变体

作者用64个随机采样的GFP变体微调METL-Local,然后通过模拟退火设计20个新变体(5或10个突变,分为Observed AA和Unobserved AA两种设置)。实验验证显示,16个设计变体具有可检测的荧光,其中Observed设置下5突变和10突变设计成功率均为100%,Unobserved设置下5突变成功率80%,10突变成功率40%。随机基线变体几乎无荧光,表明METL的设计并非偶然。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: Rosetta模拟、Transformer预训练、微调、低N学习、外推评估、GFP实验验证
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事蛋白质工程、深度学习与生物物理交叉研究的科研人员,尤其是关注低数据量学习和外推问题的研究者。

带走一句

生物物理模拟数据可以作为蛋白质语言模型的有效预训练来源,尤其在实验数据稀缺时能显著提升泛化能力。对于做蛋白质工程的分析人员,可以考虑将Rosetta等模拟工具生成的大规模合成数据与少量实验数据结合,构建更稳健的预测模型。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。