IF58.7|血浆蛋白质组深度学习模型同时诊断六种痴呆相关疾病
ProtAIDe-Dx用一次抽血同时给出六种痴呆相关疾病的概率诊断,并在外部记忆门诊队列中验证了共病识别能力。
ProtAIDe-Dx用一次抽血同时给出六种痴呆相关疾病的概率诊断,并在外部记忆门诊队列中验证了共病识别能力。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
神经退行性疾病常合并多种病理改变,导致诊断困难、治疗选择复杂。目前除AD外,多数神经退行性疾病缺乏敏感、特异且可扩展的血液生物标志物。血浆蛋白质组可同时监测数千种蛋白,但数据高维、存在技术伪影和非线性相互作用,且血脑屏障限制了脑源蛋白的检出。既往研究多关注单一疾病的差异蛋白,缺乏面向个体水平的多疾病联合诊断模型。
科学问题
卡在哪里: 现有血液生物标志物多针对单一疾病,难以应对临床常见的共病情况;基于血浆蛋白质组的多疾病诊断模型尚未建立,且模型在跨中心数据上的泛化能力未知。
本文要回答: 开发并验证一个基于血浆蛋白质组的深度学习模型,能够同时输出六种痴呆相关疾病的概率诊断,并评估其识别共病和辅助鉴别诊断的价值。
技术路线
作者主要用了:SomaLogic 7k血浆蛋白质组、深度多任务学习、PermFIT特征重要性、t-SNE、K-means聚类、SHAP。
作者利用GNPC队列17,187名参与者的SomaLogic 7k血浆蛋白质组数据,构建了多任务深度学习模型ProtAIDe-Dx,同时输出AD、PD、FTD、ALS、卒中/TIA和认知正常六种状态的概率。模型采用联合学习框架,通过共享底层表示捕捉疾病间共病信号。训练时仅使用蛋白质组数据,不纳入任何临床或人口学信息。通过十折交叉验证评估性能,并在留一中心交叉验证和外部BioFINDER-2队列中检验泛化能力。随后利用模型输出的概率和嵌入进行疾病异质性分析、生物标志物关联验证和临床效用评估。

图 1 Fig. 1。图1展示了研究整体流程和模型性能。a部分显示GNPC数据用于十折交叉验证开发模型,并在BioFINDER-2外部验证;b部分比较了ProtAIDe-Dx与XGBoost、随机森林、TabPFN的平衡准确率和AUC,ProtAIDe-Dx在多数任务上最优;c和d显示AD概率与APOE ε4剂量正相关、与MMSE负相关;e显示模型嵌入能预测健康对照的纵向认知进展(BCA=70%)。
核心亮点
亮点 1|多任务学习提升不平衡样本诊断性能
ProtAIDe-Dx在GNPC十折交叉验证中,ALS和PD的平衡准确率分别达95%和92%,AD为81%,FTD为72%,卒中/TIA为70%,AUC均超过0.78。与XGBoost、随机森林和TabPFN相比,ProtAIDe-Dx在多个任务上显著更优,尤其在AD、FTD和卒中分类中。模型输出的AD概率与APOE ε4等位基因剂量正相关,与MMSE评分负相关,提示概率可作为连续的疾病进展指标。

图 2 Fig. 2。图2利用t-SNE将六种疾病概率降维到二维空间。a显示患者按临床诊断聚集;b-d显示CDR、APOE ε4和高血压在概率图上的分布符合预期;e显示MCI-SCI患者散布于各疾病区域;f-i展示K-means聚类发现的亚群,如AD的次要亚群与卒中/TIA区域重叠,ALS的次要亚群靠近FTD区域,且这些亚群在临床特征和蛋白质组上存在差异。
亮点 2|诊断概率揭示疾病异质性与共病
将模型输出的六种疾病概率进行t-SNE降维后,患者按临床诊断自然聚集,且不受采样中心影响。在AD、ALS等诊断组内发现多个亚群,其中AD的一个次要亚群与卒中/TIA区域重叠,表现出更高的血管风险因素和更差的认知;ALS的一个亚群靠近FTD区域,C9orf72突变率更高。这些亚群在蛋白质组水平上呈现不同的通路富集模式,提示同一临床诊断下存在生物学异质性。

图 3 Fig. 3。图3展示模型解释结果。a显示PermFIT识别的关键蛋白,如NEFL、CLU、SMOC1等;b显示模型嵌入的器官富集分析,脑特异性蛋白高度富集;c显示嵌入与疾病诊断的关联及GO富集分析,揭示Z2与神经元功能、Z23与胶质细胞通路相关。
亮点 3|模型解释揭示疾病特异蛋白网络
PermFIT特征重要性分析识别出NEFL、CLU、SMOC1、CPLX2等已知疾病标志物,以及SERPINF2、CNTFR、HEY1等新候选蛋白。模型嵌入的蛋白质组成分析显示,脑特异性蛋白在所有嵌入中高度富集,其中嵌入Z2可能代表神经元功能衰退,Z23可能反映胶质细胞脆弱性通路。这些嵌入与外部队列中的AD、血管病理生物标志物显著相关。

图 4 Fig. 4。图4评估模型泛化能力和生物标志物关联。a显示留一中心交叉验证中ProtAIDe-Dx仍优于基线模型,但性能下降;b显示在BioFINDER-2上的泛化性能接近留一中心验证的中位数;c显示嵌入与生物标志物的相关性;d显示在CU个体中,模型概率与AD、Lewy body和血管病理生物标志物显著相关。
亮点 4|外部记忆门诊队列中验证并提升鉴别诊断
在BioFINDER-2队列中,ProtAIDe-Dx的预测概率与AD、血管病理生物标志物显著相关,且能在认知未受损个体中识别出临床前病理。将ProtAIDe-Dx嵌入与年龄、性别、MMSE、p-tau217、NEFL和皮层厚度等临床标志物结合后,多分类鉴别诊断的平衡准确率显著高于仅用临床标志物的模型,尤其在非AD痴呆中增益明显。

图 5 Fig. 5。图5展示临床效用分析。a显示加入ProtAIDe-Dx嵌入后,多分类鉴别诊断的平衡准确率显著提高,尤其在非AD痴呆中;b显示基线预测诊断能显著分层纵向MMSE下降轨迹;c显示高AD概率对应高tau-PET或p-tau217阳性率,高卒中概率对应高白质高信号负荷;d显示两截断策略在SCD患者中实现>90%的特异性和阳性预测值。
亮点 5|预测概率分层纵向认知衰退轨迹
在GNPC中,基线临床诊断不能区分后续MMSE下降速率,但ProtAIDe-Dx的基线预测诊断能显著分层认知衰退轨迹(FDR<0.05)。在BioFINDER-2中,被预测为AD的MCI患者比预测为对照的MCI患者认知下降更快(FDR=0.0015)。此外,AD概率>0.9时,大多数患者tau-PET或CSF p-tau217阳性,卒中概率>0.7时白质高信号负荷显著升高。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: SomaLogic 7k血浆蛋白质组、深度多任务学习、PermFIT特征重要性、t-SNE、K-means聚类、SHAP
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事神经退行性疾病生物标志物、蛋白质组学或临床预测模型研究的科研人员和生信分析师。
带走一句
多任务深度学习模型能从血浆蛋白质组中同时提取多种神经退行性疾病的信号,并在外部队列中提供超越现有临床标志物的鉴别诊断价值,为共病识别和个体化风险评估提供了新范式。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。