周启涛生物技术工作室
多组学与方法2025/09/17· 编译自 Nature

IF50.5|生成式Transformer学习人类疾病自然史

Delphi-2M用GPT架构同时预测千余种疾病风险,并可采样未来健康轨迹。

Delphi-2M用GPT架构同时预测千余种疾病风险,并可采样未来健康轨迹。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

医疗决策依赖对患者过去和当前健康状态的理解,以预测并改变其未来病程。人工智能方法有望通过从大规模健康记录中学习疾病进展模式来辅助这一任务。人类疾病进展以共病簇为特征,受生活方式、遗传和社会经济因素影响。现有预测算法多针对单一疾病,如心血管病或癌症,但能预测全谱系人类疾病的算法极少。国际疾病分类第十版(ICD-10)顶层有超过1000种诊断。老龄化社会疾病负担预测对医疗规划至关重要。大型语言模型(LLM)通过建模token序列依赖生成上下文相关文本,其类比于疾病进展建模:识别过去事件并利用其相互依赖预测未来发病序列。已有BERT等模型用于特定预测任务,但全面生成式多病种建模潜力尚未充分评估。

科学问题

卡在哪里: 现有疾病预测模型多局限于单一疾病,难以同时处理上千种诊断及其时间依赖关系。传统流行病学模型难以量化既往事件对未来的时间依赖性影响。此外,缺乏能够生成合成健康轨迹、保护隐私的生成式模型。

本文要回答: 本文旨在扩展GPT架构以建模人类疾病进展和竞争风险,训练一个能同时预测上千种疾病发生率、采样未来健康轨迹、并提供可解释性的模型Delphi-2M。

技术路线

作者主要用了:GPT-2架构扩展、连续时间编码、指数等待时间模型、SHAP解释、UMAP可视化

作者将个体健康轨迹表示为按年龄记录的ICD-10诊断代码序列,并加入生活方式、性别和“无事件”填充token。基于GPT-2架构,将位置编码替换为连续年龄的正弦余弦编码,增加指数等待时间输出头以预测事件间隔,并修改因果注意力掩码以处理同时发生的事件。模型在UK Biobank 40万参与者数据上训练,通过超参数筛选确定约200万参数的最优规模,并在丹麦190万个体注册数据上进行外部验证。随后评估其预测性能、生成能力、可解释性及偏差。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示Delphi模型架构和训练流程。a显示健康轨迹由ICD-10诊断、生活方式和填充token按年龄排列组成。b展示UK Biobank和丹麦注册数据的训练/验证/测试划分。c对比GPT-2与Delphi架构,红色标注修改:连续年龄编码、指数等待时间输出头、同时事件掩码。d示例输入提示和输出采样。e显示模型性能随参数量增加而提升,约200万参数最优。f消融实验显示各架构修改对交叉熵的贡献。g显示Delphi能一致估计事件间隔时间。

核心亮点

亮点 1|多病种预测性能媲美专科模型

Delphi-2M在内部验证集上平均年龄分层AUC约0.76,97%的诊断AUC>0.5,死亡预测AUC达0.97。与临床风险评分相比,心血管病和痴呆预测性能相似,死亡预测更优,但糖尿病预测不如HbA1c单一标志物。与基于67种生物标志物的MILTON模型相比,Delphi-2M在多数诊断上AUC更高。在丹麦外部验证中平均AUC为0.67,与UKB纵向测试的0.69接近,疾病间预测性能高度相关(Pearson r=0.76),表明模型跨医疗系统泛化能力较强。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示多病种发病率预测性能。a显示9种疾病和死亡的预测率随年龄变化,点表示个体预测,颜色区分性别,深色为诊断前预测,紫线和青线为训练数据观察率。b显示平均年龄-性别分层AUC随训练出现次数的变化,死亡AUC最高。c和d显示不同ICD-10章节和性别的AUC分布。e显示预测性能随时间下降但10年后仍保持。f与临床风险评分比较,Delphi在心血管病和痴呆上相似,死亡更优,糖尿病不如HbA1c。

亮点 2|生成未来健康轨迹并支持合成数据训练

利用60岁前数据采样未来轨迹,在70-75岁年龄段模拟的疾病发生率与观察值高度吻合。第一年正确预测17%的疾病token,20年后降至14%,显著优于仅用年龄性别的12-13%。按吸烟、饮酒、BMI分层的人群疾病负担变化被准确预测。完全从出生采样的合成数据复现了年龄和性别特异性发病率模式,且与训练数据无过度相似。仅用合成数据训练的Delphi模型在真实验证集上平均AUC达0.74,仅比原始模型低3个百分点,证明合成数据可保护隐私并保留关键信息。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示未来健康轨迹采样。a实验设计:用60岁前数据模拟轨迹并与观察结果比较。b显示70-75岁模拟发病率与观察值高度一致。c显示正确预测诊断比例随预测年限下降,但始终高于仅用年龄性别的基线。d显示按吸烟、饮酒、BMI分层的人群疾病负担变化被准确预测。e显示从出生采样的合成数据复现年龄-性别发病率模式。f显示仅用合成数据训练的模型在真实数据上AUC达0.74,接近原始模型。

亮点 3|SHAP揭示共病簇和时间依赖性影响

UMAP显示疾病嵌入按ICD-10章节聚类,如女性生殖道癌症、糖尿病与视网膜病变、高急性死亡率疾病与死亡聚在一起。SHAP分析显示消化道疾病诊断使胰腺癌风险增加19倍,胰腺癌诊断使死亡率增加近万倍。平均SHAP效应矩阵显示共病影响多发生在同一章节内,如精神障碍和妊娠相关疾病形成明显簇。时间依赖性分析表明癌症对死亡率影响持续数年,而败血症影响在5年内消退,与Nelson-Aalen分析一致。注意力图也显示癌症token被长期关注,而败血症等短期关注。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示模型可解释性分析。a UMAP投影显示疾病嵌入按ICD-10章节聚类,如女性生殖道癌症、糖尿病与视网膜病变、高死亡率疾病与死亡。b SHAP解释个体轨迹:消化道疾病使胰腺癌风险增加19倍,胰腺癌使死亡率增加近万倍。c平均SHAP效应矩阵显示共病影响多在同一章节内,精神障碍和妊娠相关疾病形成簇,10年后效应减弱。d显示癌症对死亡率影响持续数年,败血症影响短期消退。

亮点 4|数据源偏差被模型学习并放大

UK Biobank数据来自自我报告、初级保健、医院记录、癌症和死亡登记等多个来源,不同来源贡献不同疾病token。模型学会了数据收集模式:有医院记录史的个体,其医院专属疾病预测率平均高10倍。例如败血症93%在医院诊断,有医院数据的个体预测率高出8倍。这些关联部分反映真实诊疗路径,但部分是数据聚合不完整造成的伪影。此外,UK Biobank健康志愿者偏倚和招募前死亡缺失导致死亡率估计偏差,模型在80岁以上人群建模不可靠。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示外部验证和偏差评估。a比较UKB纵向测试和丹麦外部测试的AUC,两者高度相关。b显示Delphi-2M预测的死亡率与UKB观察值和英国国家统计局估计值比较,UKB因招募存活者导致死亡率低估。c UpSet图显示UKB验证队列中疾病数据来源的可用性。d显示不同数据源贡献的疾病token类型。e和f显示有医院记录史的个体医院专属疾病预测率更高。g显示SHAP效应矩阵中数据源相关聚簇。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: GPT-2架构扩展、连续时间编码、指数等待时间模型、SHAP解释、UMAP可视化
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事电子健康记录建模、多病种风险预测或生成模型应用的研究者。

带走一句

生成式Transformer可统一建模上千种疾病的时序风险,其采样能力为隐私保护的数据增强和疾病负担预测提供新范式。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。