周启涛生物技术工作室
结构与蛋白质组2024/09/25· 编译自 Nature

IF50.5|蛋白质稳定性的遗传架构:加性能量模型即可高精度预测

在超过10^10的序列空间中,蛋白质稳定性遗传架构出奇简单,可解释能量模型即可准确预测。

在超过10^10的序列空间中,蛋白质稳定性遗传架构出奇简单,可解释能量模型即可准确预测。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

蛋白质序列空间极其庞大,例如100个氨基酸的蛋白质有20^100种可能序列,远超宇宙原子总数。实验和计算都只能探索极小一部分。深度神经网络虽被用于导航高维序列空间,但模型极其复杂且难以解释。已有大规模平行实验可测量单突变和双突变对蛋白质稳定性的影响,但高阶突变组合数量爆炸,实验不可行。此前研究提示蛋白质基因型-表型景观可能比预想简单,能量测量和统计模型暗示加性效应占主导,但缺乏在高维序列空间中的直接验证。

科学问题

卡在哪里: 此前实验最多分析约10^6个基因型,且随机组合突变几乎总是导致蛋白质失折叠,无法有效探索高阶序列空间。深度学习方法虽能预测,但缺乏可解释性。蛋白质遗传架构究竟有多复杂、需要多少参数和相互作用才能准确预测,仍是未解问题。

本文要回答: 本文旨在通过实验设计富集功能性序列,探索超过10^10基因型的高维序列空间,检验蛋白质稳定性遗传架构是否简单,并量化加性能量项和成对能量耦合的贡献。

技术路线

作者主要用了:深度突变扫描、组合诱变、AbundancePCA、BindingPCA、热力学建模、神经网络

作者利用贪婪算法从单突变数据出发,迭代选择能同时保持折叠和功能的突变,构建了包含34个单突变的所有组合文库(约1.7×10^10基因型)。通过AbundancePCA和BindingPCA高通量筛选,测量了数十万变体的丰度和结合表型。随后用基于热力学平衡的神经网络模型(MoCHI)拟合数据,推断每个单突变的折叠自由能变化(ΔΔGf)和成对能量耦合(ΔΔΔGf),并与线性模型比较预测性能。进一步分析耦合与结构距离、主链距离的关系,并在另一个蛋白SRC中验证普适性。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了实验设计逻辑和文库构建。a显示随机突变组合导致折叠比例急剧下降,5个突变仅2-8%折叠,10个突变<0.2%。b为贪婪算法流程:从单突变数据出发,迭代选择能同时保持丰度和结合的突变,最终得到34个单突变组合。c-e显示文库测序覆盖和基因型频率分布,与理论预期一致。f显示即使超过20个突变,仍有数千变体丰度与野生型无显著差异,证明设计成功富集了功能性高阶突变体。

核心亮点

亮点 1|加性能量模型解释一半以上变异

仅用单突变和双突变数据训练的加性能量模型(无上位性),在包含多达34个突变的组合突变体中解释了50%的丰度变异(R²=0.5)。相比之下,线性模型仅解释32%且系统低估表型效应。能量模型通过全局非线性(全局上位性)正确捕捉了蛋白质热力学行为:在已失折叠的蛋白中引入去稳定突变不再影响折叠分数。用组合数据重新训练后,能量模型R²提升至0.63,线性模型为0.62,但线性模型残差有偏。推断的单突变自由能变化与浅层双突变库结果高度相关(Pearson's r=0.87),但组合数据估计更极端,说明在更多遗传背景中测量能更准确估计能量效应。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2比较了线性模型和能量模型的预测性能。a为二态平衡模型和神经网络架构,将自由能变化映射到折叠分数。b显示在组合数据上,能量模型(R²=0.63)优于线性模型(R²=0.62),且线性模型残差有偏。c展示能量模型完美捕捉全局非线性关系。d显示组合数据推断的单突变自由能变化与浅层双突变库结果高度相关但更极端。e显示加入成对耦合后R²提升至0.72。f显示一阶项偏向去稳定,二阶耦合围绕零分布。

亮点 2|成对能量耦合稀疏且与结构接触相关

加入所有成对能量耦合(ΔΔΔGf)后,模型性能额外提升9%(R²=0.72)。共推断出561个成对耦合,其强度与残基间3D距离呈L形分布:最强耦合几乎都发生在空间邻近的残基对(前5名均<5.5 Å,前20名中75%<8 Å)。但耦合强度与主链距离的相关性更强(Spearman's ρ=-0.28),且排除直接接触后依然显著(ρ=-0.27)。线性回归模型基于12个结构特征(包括氢键、盐桥、范德华力等)可预测耦合强度(R²=0.21),并在独立文库中验证。这表明能量耦合主要由结构相互作用驱动,且沿主链衰减。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3揭示能量耦合的结构决定因素。a显示耦合强度与3D距离的L形分布,最强耦合均发生在空间邻近残基。b显示耦合强度与主链距离的负相关,且排除直接接触后仍显著。c为相互作用矩阵,显示强耦合沿对角线(主链邻近)和对应结构接触点分布。d为结构映射,显示强耦合位于二级结构间接触。e列出12个结构特征。f显示线性模型可预测耦合强度,并在独立文库中验证。

亮点 3|主链邻近性独立于3D接触决定耦合强度

为区分3D接触和主链距离的贡献,作者设计了四个空间邻近但主链距离不同的表面残基的饱和突变文库(library 2)。尽管这些残基在3D空间中大多<5 Å,但耦合强度与接触距离无相关性(Spearman's ρ=-0.05),而与主链距离显著相关(ρ=-0.41),平均能量项与主链距离的相关性高达ρ=-0.94。这直接证明主链邻近性是能量耦合的独立决定因素,可能源于沿肽链的扰动传播。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示library 3的设计和双表型分析。a为GRB2-SH3结构,标记15个突变残基和GAB2配体。b为BindingPCA原理。c显示结合和丰度测量高度可重复。d显示高阶突变体中丰度与结合的关系,大多数高丰度变体仍能结合配体。e为三态平衡模型。f为神经网络架构,同时推断折叠和结合自由能变化及耦合。g-h显示模型拟合极好,解释几乎所有变异。i显示推断的自由能变化与之前数据高度相关。

亮点 4|高阶突变体仍能正确折叠并结合配体

在library 3中,作者测量了215个变体的丰度和与GAB2配体的结合。大多数改变结合的突变也改变丰度,表明稳定性是结合效应的主要驱动因素。然而,许多高阶突变体(如9个突变)仍具有与野生型相当的丰度,且其中96%仍能结合配体。这说明通过合理设计,可以在蛋白质中引入大量突变而不破坏折叠和功能。三态热力学模型(未折叠、折叠、结合)同时拟合丰度和结合数据,解释了几乎所有表型变异(R²=0.93),并首次大规模测量了折叠和结合的能量耦合。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5分析变构效应和能量耦合。a显示折叠和结合自由能变化与到配体距离的关系,结合自由能变化随距离增大而减小,第二壳层残基富集强变构效应。b为折叠和结合耦合矩阵,显示最强结合耦合位于P11-G18,这两个残基空间邻近且是仅有的长程接触,表明变构耦合也由结构接触驱动。

亮点 5|变构效应富集于配体邻近残基

在library 3中,所有突变均不在结合界面,因此对结合的影响只能通过变构机制。折叠能量变化幅度大于结合能量变化。结合能量耦合最强的相互作用发生在P11和G18之间,这两个残基空间邻近且是仅有的两个长程接触之一。结合自由能变化与到配体的距离呈负相关(Spearman's ρ=-0.46),第二壳层残基和序列上邻近结合界面的残基富集强变构效应。远端甘氨酸残基的突变对结合亲和力影响最大,与之前研究一致。

亮点 6|在SRC激酶中验证模型普适性

为检验结论的普遍性,作者在无关且更大的蛋白——人原癌基因酪氨酸蛋白激酶Src(SRC)中设计了类似的组合文库(215个变体)。二阶能量模型高度预测丰度变化(R²=0.87),能量耦合同样与3D空间邻近性和主链邻近性相关。这支持了蛋白质稳定性遗传架构简单性的普遍性,至少在球状蛋白中成立。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

做蛋白功能预测时,别急着上深度学习。先试试可解释的加性能量模型,加上稀疏的成对耦合,往往就能在高维序列空间中获得很好的预测,而且参数少、能告诉你为什么。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。