周启涛生物技术工作室
多组学与方法2025/05/02· 编译自 Nature Biotechnology

IF46.9|组织特异蛋白关联图谱助力疾病基因优先级排序

用7811例人类活检蛋白质组数据,构建11个组织的蛋白关联图谱,揭示超25%关联具组织特异性。

用7811例人类活检蛋白质组数据,构建11个组织的蛋白关联图谱,揭示超25%关联具组织特异性。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

蛋白质相互作用介导细胞的结构与功能,其异常可导致疾病。近年来,质谱技术结合高通量筛选(如酵母双杂交、亲和纯化、共分级)已能大规模发现蛋白质相互作用,并催生了多个高质量公共数据库。然而,这些数据库通常不区分组织背景,而互作组具有高度组织或细胞状态特异性,仅不到一半的蛋白质组在所有组织中均被检测到。阐明蛋白质相互作用的组织特异性对于理解细胞类型特异功能、寻找药物靶点以及系统理解人类细胞至关重要。已有研究尝试利用基因表达数据构建组织特异网络,但mRNA共表达预测蛋白质关联的准确性有限,且基因表达在多大程度上驱动蛋白质互作变化尚不清楚。蛋白质共丰度已被证明是预测蛋白质关联的准确指标,因为蛋白复合物亚基通常以固定化学计量比组装,孤儿亚基常被降解。

科学问题

卡在哪里: 现有蛋白质互作数据库通常不区分组织背景,而互作组高度组织特异。早期基于基因表达的方法准确性有限,且不清楚基因表达是否是蛋白质互作变化的主要驱动因素。实验方法虽能建立组织特异互作,但资源消耗大,且常使用永生化细胞系,可能无法代表真实人体组织。因此,缺乏一种系统、可扩展的方法来评估蛋白质关联的组织特异性。

本文要回答: 利用大规模蛋白质组数据,系统构建人类多组织的蛋白质关联图谱,评估组织特异性程度,并验证其在疾病基因优先级排序中的应用价值。

技术路线

作者主要用了:蛋白质共丰度分析、逻辑回归、共分级、AlphaFold2、GWAS、SynGO

作者收集了50项癌症蛋白质组学研究,涵盖14个组织、7811例样本(5726例肿瘤和2085例癌旁正常组织)。对每个队列,计算蛋白对之间的Pearson相关系数作为共丰度估计,并以CORUM数据库中的蛋白复合物亚基对为正例,拟合逻辑回归模型将相关系数转换为关联概率。随后,将同一组织的多个队列的关联概率聚合为组织水平的关联分数,构建包含11个组织、1.16亿蛋白对的关联图谱。为验证脑组织关联,作者还进行了大鼠突触体共分级实验,并整合了已发表的小鼠脑和胶质母细胞瘤共分级数据,构建突触互作组。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了数据来源和工作流程。a显示各组织的肿瘤和健康样本数量,深蓝为等重标记多重蛋白质组学,浅蓝为其他方法。b示意蛋白复合物亚基以固定化学计量比存在,通过蛋白丰度相关性估计共丰度,并用逻辑回归转换为关联概率。c显示肺组织中关联概率的ROC曲线,蛋白共丰度AUC最高。d和e比较了不同数据类型的AUC,蛋白共丰度优于共分级和mRNA共表达,且结合mRNA未显著提升。f显示同一组织的队列聚类在一起。g显示组织特异关联主要被同组织队列恢复。

核心亮点

亮点 1|蛋白共丰度优于共分级和mRNA共表达

在肺组织中,蛋白共丰度预测已知复合物成员相互作用的AUC为0.80±0.01,显著高于蛋白共分级(AUC=0.69±0.01)和mRNA共表达(AUC=0.70±0.01)。将mRNA与蛋白数据结合并未显著提升性能(AUC=0.82±0.01,P=0.15)。此外,回归掉基因表达对蛋白丰度的影响后,AUC仅轻微下降至0.78±0.01(P=0.18),表明蛋白关联的预测力主要来自转录后调控而非基因表达变化。这一结果确立了蛋白共丰度作为推断蛋白关联的可靠方法。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了组织水平关联分数的构建和特性。a示意聚合同一组织多个队列得到单一关联分数。b显示肿瘤来源分数在恢复已知互作方面优于健康组织来源分数(AUC=0.87 vs 0.82)。c显示肿瘤来源分数能恢复健康组织的组织特异关联(AUC=0.74 vs 0.53)。d展示关联图谱中可能关联(分数>0.5)和高置信关联(分数>0.8)的数量。e显示可能关联在重复组织中的重现率高于不同组织。f显示不同数据库注释的互作在组织间的相似性,CORUM复合物相似性最高。

亮点 2|构建11个组织的蛋白关联图谱

聚合同一组织的多个队列后,肿瘤来源的关联分数在恢复已知蛋白互作方面优于健康组织来源的分数(AUC=0.87±0.01 vs 0.82±0.01,P=8.3×10⁻⁵)。最终图谱包含11个组织、1.16亿蛋白对的关联分数。每个组织平均有5600万蛋白对具有关联分数,其中1000万对为可能关联(分数>0.5,平均准确率0.81),49万对为高置信关联(分数>0.8,平均准确率0.99)。这些关联倾向于仅在少数组织中存在,仅99103个蛋白对在所有组织中均为可能关联。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示了组织特异关联的实例和系统分析。a显示AP2复合物亚基与突触蛋白(NECAP1、BIN1)在脑中的关联分数高于其他组织,而非突触蛋白(DAB2、NECAP2)则相反。b展示血红蛋白与贫血、乳糜微粒与克罗恩病、纤维蛋白原与肝病的组织特异关联。c示意计算性状与细胞组分关系分数的方法。d显示关系分数在不同组织间的分布。e展示脑特异性状(如强迫症)与细胞组分的关系,以及这些组分富集强迫症相关基因的情况。

亮点 3|超25%关联具组织特异性,且不主要由基因表达驱动

通过比较健康与肿瘤来源的重复关联分数,发现46.3%的可能关联(分数>0.5)和90.2%的高置信关联(分数>0.8)在重复组织中重现。比较不同组织时,这些比例分别降至32.9%和54.6%。据此估计,18.8%-34.0%的可能关联为组织特异。进一步分析显示,仅最多7%的组织间关联差异可归因于基因表达差异(通过检测缺失),因此总体超过25.8%的关联为组织特异。此外,细胞类型特异结构(如突触组分)是组织间关联差异的重要驱动因素。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了精神分裂症(SCZ)相关基因的脑网络构建与验证。a示意利用GWAS变异、性状-细胞组分关系和脑关联分数优先排序SCZ相关基因。b显示脑网络富集SCZ相关小鼠表型、药物靶点和弱GWAS变异,且特异于脑组织。c显示脑网络关联显著富集于pulldown实验验证的互作。d展示经pulldown验证的脑互作网络,包含多个SCZ候选基因。e显示AlphaFold2预测的14-3-3蛋白与HCN1的互作界面,位于HCN1 C端无序区。

亮点 4|脑组织关联网络验证并优先排序精神分裂症基因

以369个精神分裂症(SCZ)GWAS基因为起点,构建脑组织特异关联网络。去除起始基因后,剩余基因仍显著富集于SCZ相关小鼠表型(BH校正P=1.5×10⁻⁵)、药物靶点(BH校正P=9.8×10⁻⁵)和弱GWAS变异(BH校正P=1.0×10⁻⁷),且该富集特异于脑组织。进一步用人类脑细胞pulldown实验数据验证,脑网络中的关联显著富集于实验验证的互作(log BH校正P=84.3),而其他组织平均仅为1.8。最终得到205个经pulldown验证的脑互作,其中包含多个SCZ候选基因。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了突触体共分级实验和突触互作组。a示意大鼠突触体纯化、SEC分级和质谱分析流程,右侧显示CCT复合物亚基的洗脱曲线。b显示共分级研究的AUC,合并的突触互作组AUC=0.80,优于单个数据集。c显示突触蛋白间的关联在脑组织中更可能。d展示脑疾病相关基因的突触互作网络,包含多个候选基因。

亮点 5|突触体共分级实验验证脑关联并构建突触互作组

纯化大鼠突触体并进行尺寸排阻色谱分级,质谱检测到3409个蛋白。整合小鼠脑和胶质母细胞瘤共分级数据,构建包含1619个蛋白、130万互作概率的突触互作组,AUC达0.80,优于单个数据集(0.72)。该互作组中24%蛋白为SynGO注释的突触蛋白,49%为突触富集,56%曾被交联质谱鉴定。突触蛋白间的互作概率显著高于非突触蛋白(平均分数0.40 vs 0.36,P<1×10⁻³⁰⁰)。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 蛋白质共丰度分析、逻辑回归、共分级、AlphaFold2、GWAS、SynGO
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事蛋白质组学、网络生物学或疾病遗传学研究的科研人员,尤其关注组织特异互作和疾病基因发现者。

带走一句

蛋白共丰度是推断组织特异蛋白关联的可靠方法,可整合多队列数据构建组织水平图谱,为疾病基因优先级排序提供功能证据。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。