周启涛生物技术工作室
基因组与遗传2025/01/08· 编译自 Nature

IF50.5|500个人类蛋白结构域饱和突变揭示稳定性与致病机制

大规模实验量化50万+错义变异对蛋白稳定性的影响,揭示稳定性在遗传病中的核心作用。

大规模实验量化50万+错义变异对蛋白稳定性的影响,揭示稳定性在遗传病中的核心作用。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

错义变异改变蛋白氨基酸序列,导致约三分之一的人类遗传病。当前人群中存在数千万错义变异,但绝大多数功能未知。实验研究此前多局限于单个或少数蛋白,难以全面评估变异效应。蛋白结构域是独立折叠的功能单元,人类基因组编码数千种结构域,其小尺寸和独立折叠特性使其适合高通量突变分析。已有研究表明蛋白稳定性降低是致病性变异的常见机制,但缺乏跨多个疾病基因的大规模验证。

科学问题

卡在哪里: 此前实验数据仅覆盖少数蛋白,无法系统评估稳定性在人类遗传病中的贡献及其在不同蛋白和疾病中的差异。同时,缺乏大规模一致的数据集来训练和基准测试计算预测方法,也缺少对同源结构域间突变效应保守性的定量分析。

本文要回答: 本文旨在通过大规模饱和突变实验,量化500多个蛋白结构域中50万+错义变异对蛋白稳定性的影响,并利用该数据集解析稳定性在遗传病和进化中的角色。

技术路线

作者主要用了:微芯片并行合成、aPCA蛋白丰度互补实验、高通量测序、蛋白语言模型、热力学建模

作者利用微芯片大规模并行合成技术构建了包含1,230,584个氨基酸变异的文库,覆盖1,248个结构域。通过aPCA蛋白丰度互补实验,在酵母细胞中筛选变异对结构域稳定性的影响。每个变异与DHFR酶片段融合,稳定性降低导致蛋白降解和细胞生长减缓。通过高通量测序比较输入和输出文库中变异频率变化,量化每个变异的丰度效应。最终获得522个结构域的563,534个变异数据,并利用蛋白语言模型和热力学模型进行深入分析。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了实验策略和整体数据质量。a部分显示从文库构建、转化、选择到测序的流程。b部分说明aPCA原理:变异导致去折叠和降解,降低DHFR活性,抑制细胞生长。c部分显示重复间Pearson r中位数为0.85。d部分显示突变效应与残基埋藏面积相关,核心残基突变更有害。e-g部分显示结构域结构多样性、与体外ΔΔG的相关性(中位ρ=0.73)以及与蛋白酶敏感性数据的相关性(中位ρ=0.65)。

核心亮点

亮点 1|60%致病错义变异降低蛋白稳定性

在621个致病性变异中,380个(61%)导致结构域显著去稳定化,303个(48%)为强去稳定化。相比之下,良性变异中仅40%去稳定化,16%强去稳定化。稳定性对致病性的贡献在不同结构域家族中差异显著:β/γ晶状体蛋白中13/18个致病变异强去稳定化(OR=11.98),而DNA结合结构域如homeodomain、HMG-box中致病变异较少由稳定性驱动,提示其他机制如DNA结合功能丧失。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了五个最丰富蛋白家族结构域的深度突变扫描热图。每个热图x轴为残基位置,y轴为19种突变氨基酸,颜色表示aPCA适应度。热图显示核心区域突变普遍有害,表面区域耐受性较高,不同家族间模式存在差异。例如homeodomain的DNA结合螺旋区域对突变敏感,PDZ结构域的配体结合口袋区域也有明显约束。

亮点 2|稳定性在隐性遗传病中作用更突出

比较显性和隐性遗传病基因,稳定性解释蛋白进化适应度的方差中位数在隐性病中为44%,显性病中仅26%(P=1.1×10^-3)。功能丧失和聚集性疾病比功能改变性疾病(如功能获得或显性负效应)更易由蛋白去稳定化解释。例如FHL1的LIM2结构域中稳定性完美分类致病变异(MCC=1),而MECP2的甲基结合结构域中许多Rett综合征致病变异并不去稳定化,而是富集于DNA结合界面。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3比较了稳定性测量数据量与计算预测性能。a部分显示本数据集使人类错义变异稳定性测量数量增加近5倍。b部分显示ESM1v和ThermoMPNN预测与实验值的相关性(中位ρ分别为0.48和0.50)。c部分比较多种预测器性能,ThermoMPNN最佳。d-f部分展示利用sigmoid拟合稳定性与ESM1v适应度关系,残差鉴定功能位点。g-h部分显示功能位点富集于CDD注释。

亮点 3|稳定性解释进化适应度的比例因结构域而异

通过比较实验测定的稳定性与ESM1v预测的进化适应度,发现稳定性在所有结构域中解释适应度方差的中位数为30%。全β结构域中稳定性贡献更高(40%),全α和混合结构域为25%。不同功能结构域中稳定性贡献也不同:SH3、WW、PHD指等蛋白-蛋白相互作用结构域中稳定性贡献较大,而DNA结合结构域如HMG-box、核激素受体型锌指和homeodomain中贡献较小。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4分析了稳定性与致病性的关系。a部分显示致病性变异比良性变异更倾向于去稳定化。b部分显示不同结构域家族中强去稳定化致病变异的比例差异。c部分展示FHL1 LIM2、TP63 SAM、MECP2 MBD和CRX homeodomain中稳定性对致病性的分类性能(MCC分别为1、0.83、0.4、0.52)。d部分显示MECP2和CRX中非去稳定化致病变异富集于DNA结合界面。f-g部分显示稳定性对适应度的解释力与对致病性的解释力相关,且在隐性病中更高。

亮点 4|结合稳定性与语言模型鉴定功能位点

利用sigmoid曲线拟合稳定性与ESM1v适应度的关系,残差分析鉴定出102,231个突变(24%)对进化适应度的影响超出稳定性预期。这些突变富集于CDD注释的功能位点(OR=2.72)。定义进化功能位点5,231个,富集于已知DNA、RNA和蛋白结合界面(OR=4.50),并发现1,942个新位点,其中许多位于功能位点附近的第二壳层残基。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了同源结构域家族的热力学建模。a部分为两态折叠模型。b部分为MoCHI模型架构。c-d部分显示homeodomain家族模型预测与实验值的相关性(r=0.78)。e-f部分展示推断的家族平均ΔΔG热图。g部分显示预测性能随序列差异增大而下降。h-j部分显示26个家族模型性能(中位r=0.80),留一结构域验证中位r=0.66,优于ThermoMPNN。k部分显示模型在体外蛋白水解数据上的表现(中位r=0.65)。

亮点 5|同源结构域间突变效应高度保守

对26个具有至少5个同源结构域的家族拟合加性热力学模型,发现模型能准确预测同源结构域中的突变效应(中位Pearson r=0.80)。对homeodomain家族,模型交叉验证r=0.78,留一结构域验证中位r=0.74。预测性能随序列差异增大而下降,表明存在少量上位效应。鉴定出25,410个上位性突变,富集于蛋白核心(OR=2.71),提示核心残基间遗传相互作用更强。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

大规模饱和突变数据揭示蛋白稳定性是错义变异致病的主要机制之一,但贡献因蛋白和疾病而异。同源结构域间突变效应高度保守,可基于少量实验数据预测整个家族,为变异解读和蛋白设计提供新思路。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。