周启涛生物技术工作室
基因组与遗传2026/03/30· 编译自 Nature Methods

IF36.1|共蒸馏压缩ESM家族知识至单一蛋白语言模型

仅用序列信息,VESM模型在变异效应预测上超越结构、MSA及群体遗传学方法。

仅用序列信息,VESM模型在变异效应预测上超越结构、MSA及群体遗传学方法。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

蛋白质语言模型(PLMs)已成为变异效应预测(VEP)的有力工具。当前顶尖方法多采用混合策略,结合多序列比对(MSA)、蛋白质结构或群体遗传学数据来提升预测精度,但增加了复杂性和数据依赖。相比之下,仅基于未比对序列训练的进化尺度模型(ESM)具有更广泛的适用性,但性能被认为存在固有局限。已有研究表明,不同ESM模型在检测保守结构域上存在互补性,例如ESM2无法识别KRAB结构域而ESM1b可以,反之亦然。这种互补性提示模型家族内部可能蕴含未被充分利用的进化信号。

科学问题

卡在哪里: 尽管ESM家族模型间存在互补性,但如何有效整合这些信号以提升单一模型的VEP性能,同时避免引入外部数据依赖,仍是一个未解决的问题。此前缺乏一种方法能够将多个模型的集体知识压缩到单个模型中,并保持或超越集成性能。

本文要回答: 本文旨在开发一种共蒸馏框架,通过让ESM家族模型相互学习,将集体知识压缩到单一模型中,从而在不依赖额外信息的情况下实现高精度VEP。

技术路线

作者主要用了:共蒸馏、最大置信度聚合、迭代蒸馏、知识蒸馏、ESM家族模型

作者首先提出最大置信度聚合策略(ESMIN),对每个变异取所有模型中最低的LLR(对数似然比),以捕获最敏感的进化信号。随后,利用该策略作为训练目标,对每个ESM模型进行共蒸馏,使其学习其他模型的优势。通过多轮迭代共蒸馏,最终得到一个性能超越集成的单一模型VESM-3B,并进一步蒸馏出更小规模的模型。该设计利用了模型间的互补性,并通过蒸馏将集体知识固化到单一模型中,解决了集成模型计算成本高和下游应用不便的问题。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示ESM2和ESM1b在检测保守结构域上的互补性。热图显示ZFP57的KRAB结构域被ESM1b识别为突变敏感,而ESM2预测为中性;ITM2B的BRICHOS结构域则相反。条形图量化了各模型检测多个结构域的能力,表明不同模型存在盲点,但家族内信息互补。

核心亮点

亮点 1|最大置信度聚合优于平均集成

在ClinVar和ProteinGym DMS基准上,ESMIN(取各模型LLR最小值)相比平均集成和单个模型均取得更高AUC和Spearman相关性。理论分析表明,当致病性变异的LLR方差大于良性变异时,最小值聚合能更有效分离两类。ESMIN在约50%的DMS实验中优于所有单个模型,而其他集成仅约20%。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2a展示共蒸馏框架:对每个变异,所有模型预测后取最小值作为目标,各模型通过MSE损失向该目标学习。图2b显示共蒸馏后各模型在ClinVar和ProteinGym上的性能提升,小模型提升尤为显著。图2c的消融实验表明,即使训练数据减少到1%,性能仍保持较高水平。图2d显示共蒸馏模型嵌入在下游任务上表现更好或相当。

亮点 2|共蒸馏使小模型性能大幅提升

单轮共蒸馏后,所有ESM模型性能显著提高。例如,ESM2-8M在ClinVar上的AUC从65%升至88%。共蒸馏后的ESM1b、ESM2-650M和ESM2-3B甚至超越了ESMIN本身。消融实验显示,仅用1%的人类蛋白(约200条序列)训练,ESM2-35M即可达到其峰值性能的97%和94%。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a显示共蒸馏后集成仍优于单模型,但平均聚合略优于最小聚合。图3b展示多轮共蒸馏流程。图3c显示四轮模型性能单调提升,最终VESM-3B匹配集成。图3d展示将VESM-3B蒸馏到更小模型后,性能保持且小模型提升巨大。

亮点 3|迭代共蒸馏收敛至单一高性能模型

经过三轮共蒸馏(第一轮最小聚合,后两轮平均聚合),ESM2-3B最终匹配了集成性能,称为VESM-3B。进一步将VESM-3B蒸馏到650M、150M和35M参数模型,这些模型在ClinVar和DMS上分别达到VESM-3B性能的>98%和>93%。VESM-35M相比原始ESM2-35M在ClinVar上提升超过20%,在DMS上提升超过70%。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4a比较VESM与24种方法在独立ClinVar基准上的AUC,VESM模型位居前列。ROC曲线显示VESM-3B在整个曲线上平衡。图4b的箱线图显示VESM在per-gene AUC上也表现优异。图4c显示VESM-3B在90%准确率下覆盖90%变异,优于其他方法。图4d-e显示VESM-3B在不同MAF阈值下性能稳定,而AlphaMissense在低MAF时下降。图4f显示所有VESM模型在去除AlphaMissense训练变异后仍超越AlphaMissense。

亮点 4|序列模型超越混合方法

在独立的ClinVar基准上,VESM模型超越了所有其他序列模型,并匹配或超过结构模型(如SaProt)、MSA模型(如PoET)和群体遗传学模型(如CADD)。VESM-3B在90%准确率下可注释90%的ClinVar变异,而ESM1b仅79%。与AlphaMissense相比,VESM-3B在低MAF变异上表现更优,且不受等位基因频率影响。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5a显示临床VEP性能与人类DMS性能正相关,VESM模型位于右上角。图5b按实验类型分层,VESM模型在fitness/activity和structure-related实验上均表现优异,VESM++和VESM3达到最先进。图5c的成对胜率显示VESM++和VESM3胜率最高。图5d显示VESM模型在病毒蛋白上提升最大。

亮点 5|结构信息模块化整合进一步提升性能

通过将VESM-3B蒸馏到ESM3的序列模块,得到VESM3,其在临床和DMS基准上均优于原始ESM3。结合VESM3和VESM-3B的集成模型VESM++在结构相关和功能相关DMS实验上均达到最先进性能。VESM3在85%的实验中优于ESM3_struct。

亮点 6|VESM预测连续临床表型严重程度

在UK Biobank的Genebass数据上,VESM-3B的变异评分与单变异效应量(β)显著相关,且与基因水平的pLoF burden效应方向高度一致(98.8%正确)。在103个强关联基因-表型对中,VESM++和VESM-3B的平均-log10(P)最高,超越AlphaMissense和基线模型。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 共蒸馏、最大置信度聚合、迭代蒸馏、知识蒸馏、ESM家族模型
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事变异效应预测、蛋白质语言模型开发及临床遗传学分析的研究者。

带走一句

共蒸馏提供了一种无需额外数据即可大幅提升序列模型VEP性能的通用策略,可应用于其他PLM家族。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。