周启涛生物技术工作室
多组学与方法2024/09/11· 编译自 Nature Genetics

IF31.7|多组学疾病预测模型MILTON赋能UKB遗传发现

用常规生物标志物和血浆蛋白预测3,213种疾病,并增强罕见变异关联分析。

用常规生物标志物和血浆蛋白预测3,213种疾病,并增强罕见变异关联分析。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

生物银行级数据集的兴起为发现新型生物标志物和开发疾病预测算法提供了新机遇。英国生物银行(UKB)包含50万参与者的健康记录、遗传测序数据及丰富的表型数据,如血液生化、尿液检测、身体测量和血浆蛋白质组等。既往研究已利用单一或少数生物标志物预测特定疾病(如用血浆蛋白预测痴呆),但缺乏系统性地利用多组学生物标志物预测大量疾病并用于增强遗传关联分析的方法。

科学问题

卡在哪里: 大多数生物银行的表型定义依赖账单代码和自我报告,存在参与者错误分类、数据缺失和病例对照队列定义不一致的问题。如何识别那些可能患病但未被正确编码或尚未临床诊断的“隐匿病例”,仍是未解决的挑战。

本文要回答: 开发一个基于多组学生物标志物的机器学习框架MILTON,预测UKB中3,213种疾病,并利用预测结果增强病例对照遗传关联分析,发现新的基因-疾病关联。

技术路线

作者主要用了:XGBoost、Boruta特征选择、五折交叉验证、罕见变异collapsing分析、GWAS

作者首先从UKB中提取67个定量特征(血液生化、血细胞计数、尿液检测、肺活量、身体测量、血压、年龄、性别等)作为输入,对每个ICD10疾病代码训练XGBoost分类器。通过五折交叉验证和多次随机重复,模型学习疾病特异性的生物标志物特征,并预测所有参与者的患病概率。根据预测概率将参与者分为L0-L3四个增强队列,用于后续罕见变异collapsing分析和GWAS,并与基线队列结果比较。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了MILTON的核心概念:在UKB中,某些ICD10代码诊断的个体为病例,其余为对照。病例和对照都可能携带特定基因的合格变异(QV)。罕见变异collapsing分析旨在识别QV在病例或对照中富集的基因。MILTON通过检查对照是否与已知病例具有相似的生物标志物谱来识别潜在的隐匿病例或错误分类的对照,从而增强病例队列。

核心亮点

亮点 1|MILTON预测性能超越多基因风险评分

在151个ICD10代码中,MILTON时间无关模型(67个特征)的AUC中位数为0.71,显著优于疾病特异性PRS(AUC中位数0.66,MWU P=2.71×10^-8)。对于499个随机选择的ICD10代码,MILTON(AUC中位数0.64)也显著优于所有36个标准PRS(AUC中位数0.54,MWU P=2.17×10^-82)。但在黑色素瘤、乳腺癌、前列腺癌等实体瘤中,PRS表现更好,提示血液和尿液生物标志物对这类癌症预测价值有限。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2a展示了不同时间模型的定义以及生物标志物样本采集与诊断日期之间的时间差分布。图2b显示MILTON在五个祖先和三种时间模型下的AUC性能,多个ICD10代码达到AUC≥0.7、0.8和0.9。图2c比较了EUR、SAS和AFR祖先下不同时间模型的AUC和敏感性,诊断模型通常优于预后模型。

亮点 2|血浆蛋白质组数据提升部分疾病预测

在EUR祖先的46,327名参与者中,加入2,923个血浆蛋白特征后,整体AUC中位数从0.65提升至0.68(MWU P=3.24×10^-9),52个表型AUC提升≥0.1。例如多发性骨髓瘤(C90)AUC从0.63升至0.85,主要由TNFRSF13B和TNFRSF17蛋白驱动;前列腺癌(C61)AUC从0.54升至0.76,由KLK3蛋白驱动;脊髓性肌萎缩症(G12)AUC从0.57升至0.70,由NEFL蛋白驱动。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a展示了capped分析的示意图:训练集仅包含2018年1月1日前诊断的病例,测试集为之后诊断的病例。图3b显示在1,748个ICD10代码中,MILTON预测概率≥0.7的参与者显著富集了后续诊断的病例(Fisher精确检验),且该富集在多个预测概率阈值下持续存在,证明MILTON能预测未来发病。

亮点 3|MILTON增强罕见变异关联分析发现新信号

在EUR祖先中,对MILTON增强队列进行罕见变异collapsing分析,发现2,905个显著的基因-ICD10关联(P<1×10^-8),涉及1,207个ICD10代码和165个基因。其中182个基因-疾病关联为“推定新发现”,在基线队列中未达到全基因组显著性(P>1×10^-8),且与定量表型PheWAS无关。这些新关联包括APOB-甲状腺毒症(E05)等,并在FinnGen中得到部分验证。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4a显示在149个AUC>0.6的ICD10代码中,不同祖先之间共享的顶级生物标志物数量。图4b展示了E10(1型糖尿病)、N18(慢性肾衰竭)和I50.0(充血性心力衰竭)的顶级特征重要性评分,如HbA1c、葡萄糖、胱抑素C等。图4c显示加入蛋白质组数据后性能提升的疾病的顶级特征,如C90中的TNFRSF13B和TNFRSF17。

亮点 4|MILTON预测的隐匿病例在后续随访中被证实

通过capped分析(训练集仅包含2018年1月1日前诊断的病例,测试集为之后诊断的病例),在1,740个AUC≥0.6的ICD10代码中,1,695个(97.41%)在预测概率≥0.7的参与者中显著富集了后续诊断的病例(Fisher精确检验单侧P<0.05)。该富集在预测概率阈值≥0.3时仍持续存在,验证了MILTON预测未来发病的能力。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5a展示了通过MILTON达到全基因组显著性的已知基因-疾病关联的例子。图5b和5c为曼哈顿图,显示MILTON增强队列中OR<1和OR>1的基因-ICD10关联在染色体上的分布,其中182个为推定新发现,在基线队列中未达到显著性。

亮点 5|MILTON识别疾病特异性的生物标志物组合

MILTON为每个疾病分配特征重要性评分(FIS),发现糖化血红蛋白(HbA1c)和葡萄糖是1型糖尿病(E10)的前两位预测特征;胱抑素C、尿微量白蛋白和肌酐是慢性肾衰竭(N18)的前五位特征。仅需7-8个顶级特征即可唯一表征一个疾病(基于共享顶级特征数量的变化<5%)。基于相似生物标志物谱,MILTON还生成了疾病聚类,可用于探索共病模式。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

用常规生物标志物训练的机器学习模型不仅能预测疾病,还能作为“虚拟病例”增强遗传关联分析,发现隐匿的基因-疾病信号。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。