IF36.1|C-COMPASS:神经网络解析细胞器蛋白与脂质空间分布
一个免编程的深度学习工具,让细胞器多组学空间图谱触手可及。
一个免编程的深度学习工具,让细胞器多组学空间图谱触手可及。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
细胞器是细胞功能的模块化单元,其组成随细胞类型和状态动态变化。基于密度梯度离心的蛋白质组学方法(如PCP和LOPIT)可生成数千种蛋白在多个组分中的丰度谱,用于推断亚细胞定位。然而,这些数据高度复杂:约50-60%的蛋白具有多个定位,且不同细胞器谱型常重叠。现有计算工具多基于SVM、贝叶斯或聚类,只能给出概率性单一定位,无法定量描述蛋白在多个细胞器间的分布,也难以整合蛋白质丰度或脂质组数据。此外,多数工具需要命令行操作,限制了湿实验研究者的使用。
科学问题
卡在哪里: 已有工具无法定量预测蛋白的多定位分布,不能整合全蛋白质组丰度来建模细胞器组成变化,也无法将空间分析扩展到脂质组。同时,缺乏用户友好的图形界面,使得非计算背景的研究者难以开展系统的细胞器动态研究。
本文要回答: 开发一个基于神经网络回归的免编程工具C-COMPASS,实现蛋白多定位的定量预测,并整合蛋白与脂质组数据,绘制细胞器组成动态图谱。
技术路线
作者主要用了:神经网络回归、密度梯度离心、LC-MS/MS、脂质组学、PCP、HyperLOPIT。
C-COMPASS以蛋白在梯度组分中的丰度谱为输入,利用已知单定位的标记蛋白训练神经网络,通过上采样和模拟多定位谱型增强训练集。模型输出每个蛋白在各细胞器的贡献值(CC),经阈值过滤和归一化后得到定量定位分布。对于条件比较,计算重定位分数(RLS)和距离分数(DS)识别显著变化。进一步整合全蛋白质组丰度,估算细胞器丰度并归一化,得到细胞器特异性的蛋白水平变化。最后,将同一梯度组分中的脂质丰度谱与蛋白标记谱共训练,预测脂质的亚细胞定位,实现蛋白-脂质双组学空间图谱。

图 1 Fig. 1。图1展示了C-COMPASS工作流程概览:从生物样本收集、细胞器分离、LC-MS/MS定量到生成蛋白丰度谱,然后输入C-COMPASS进行神经网络训练和预测,最终输出定位、重定位和细胞器组成分析。
核心亮点
亮点 1|神经网络定量预测多定位
C-COMPASS采用五层神经网络回归,输出蛋白在各细胞器的贡献值(CC),而非单一分类。在人类白色脂肪细胞PCP数据集上,C-COMPASS的加权F1分数(0.84)略高于SVM(0.80),且在12个细胞器中的11个上表现更优。对线粒体蛋白的预测准确率最高,仅2个假阳性;脂滴蛋白预测也因上采样而显著改善(F1从<0.01提升至0.50)。C-COMPASS还识别出MIEF1和TSPO等线粒体-脂滴双定位蛋白,提示接触位点功能。

图 2 Fig. 2。图2以人白色脂肪细胞PCP数据为例,展示C-COMPASS的验证结果:UMAP显示上采样后标记蛋白聚类清晰;F1分数显示上采样显著改善脂滴等少数类预测;线粒体预测假阳性极少;C-COMPASS与SVM比较显示更高可靠性;过滤步骤有效去除假阳性;MIEF1和TSPO被识别为线粒体-脂滴双定位。
亮点 2|跨工作流验证与重定位检测
在THP-1细胞LPS刺激的HyperLOPIT数据集上,C-COMPASS的加权F1分数在对照和LPS条件下分别达0.96和0.93。59.5%的蛋白被预测为多定位,与原始研究高度一致。C-COMPASS检测到LPS诱导的MHC-I通路和未折叠蛋白反应相关蛋白的重定位,并发现大量溶酶体到质膜、胞质到核的转移事件,与已知免疫激活过程吻合。

图 3 Fig. 3。图3展示C-COMPASS在HyperLOPIT数据上的应用:对照和LPS条件下F1分数高;CC热图显示多定位模式;与原始研究比较矩阵高度一致;LPS诱导的蛋白重定位富集于MHC-I和UPR通路;重定位事件主要发生在溶酶体-质膜和胞质-核之间。
亮点 3|模拟数据揭示分辨率需求
通过模拟不同组分数量和细胞器数量的数据集,C-COMPASS的预测误差随组分数量增加而降低。当组分数量至少为细胞器数量的两倍时,F1分数保持>0.9。对于多定位蛋白(双定位或三定位),C-COMPASS的预测误差显著低于BANDLE和DOM-ABC。在重定位检测上,C-COMPASS的区室特异性重定位误差最大仅0.048,优于BANDLE。

图 4 Fig. 4。图4展示模拟数据评估结果:预测误差随组分数量增加而降低;组分/细胞器比低时约6%蛋白未分配;F1分数在组分数量≥2倍细胞器数时最高;C-COMPASS对多定位蛋白的预测误差低于BANDLE和DOM-ABC;重定位误差矩阵显示重叠谱型是主要误差来源。
亮点 4|人源化小鼠肝脏代谢重塑图谱
在携带PNPLA3突变的人源化小鼠肝脏中,C-COMPASS比较了普通饮食、高脂高果糖(HFHF)饮食和HFHF后禁食三种状态。约2000个蛋白发生显著重定位(RLS>1),其中脂滴蛋白重定位比例最高。验证了PLIN5在禁食时从脂滴到胞质再返回脂滴的动态变化,并发现SINHCAF、RBBP7和ASF1A等SIN3-HDAC复合体亚基在禁食时从胞质/溶酶体转位至细胞核,以及COG复合体lobe B从高尔基体解离至胞质。

图 5 Fig. 5。图5展示人源化小鼠肝脏代谢实验:14组分PCP仍能分辨11个细胞器;不同饮食条件下蛋白定位分布;RLS分布显示约四分之一蛋白发生显著重定位;PLIN5、SINHCAF等蛋白的定位变化;线粒体和脂滴的细胞器组成变化分析。
亮点 5|蛋白-脂质双组学空间图谱
C-COMPASS将脂质丰度谱与蛋白标记谱共训练,预测了411种脂质在14个组分中的亚细胞定位。TAGs主要定位于脂滴,心磷脂和特定PE物种定位于线粒体,神经酰胺定位于内质网。发现PG和LPG物种的脂肪酸链长度依赖的分选:PG(18:1)定位于溶酶体,而PG(16:1)定位于线粒体。基于预测的细胞器脂质组,揭示了分泌途径中膜脂碳链长度和不饱和度的梯度变化。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 神经网络回归、密度梯度离心、LC-MS/MS、脂质组学、PCP、HyperLOPIT
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 做细胞器蛋白质组、脂质组或亚细胞定位动态的研究者,尤其是湿实验背景、需要免编程工具的人。
带走一句
C-COMPASS把细胞器空间蛋白质组学从分类问题变成了回归问题,定量多定位和重定位,还能扩展到脂质组。做细胞器动态研究的人可以直接用它的GUI,不用写代码。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。