IF31.7|跨生物库电子健康记录风险评分的通用性与多基因评分的互补性
EHR风险评分跨三国生物库可转移,且与多基因评分正交,联合预测更优。
EHR风险评分跨三国生物库可转移,且与多基因评分正交,联合预测更优。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
大规模遗传研究和电子健康记录(EHR)的普及使得结合两者来预测疾病风险成为可能。多基因评分(PGS)利用基因组信息估计遗传风险,但其跨祖先可转移性差,且未常规用于临床。EHR数据包含诊断史、实验室检查等丰富信息,但存在噪声和编码差异,其跨医疗系统通用性研究较少。已有少数研究显示EHR模型可在不同系统间转移,但缺乏与PGS的直接比较。PheRS框架利用纵向诊断码构建风险评分,已在部分疾病中显示出预测潜力。然而,PheRS在不同国家医疗系统中的通用性以及其与PGS的互补性尚未得到系统评估。
科学问题
卡在哪里: 此前研究多局限于单一EHR系统,缺乏跨国家、跨医疗系统的验证;同时,EHR风险评分与PGS之间的相关性及联合预测价值尚不清楚,尤其对于多种常见疾病。
本文要回答: 在三个大型生物库中系统比较PheRS与PGS的预测性能和跨研究通用性,并评估两者联合使用的附加价值。
技术路线
作者主要用了:弹性网络、Cox比例风险模型、phecode映射、PGS、跨生物库验证。
作者在芬兰FinnGen、英国UKB和爱沙尼亚EstB三个生物库中,针对13种常见疾病,利用10年观察期内的诊断码(phecode)训练弹性网络模型得到PheRS,并与基于GWAS的PGS进行比较。采用前瞻性设计,观察期与预测期之间设置2年洗脱期以排除近期诊断。模型在内部测试集评估,并跨研究进行外部验证。通过Cox模型评估风险关联,计算c-index比较预测准确性,并分析PheRS与PGS的相关性及联合模型的增量效果。

图 1 Fig. 1。图1展示了研究设计:每个疾病研究包含10年观察期和8年预测期,中间有2年洗脱期。病例和对照基于预测期内的诊断定义,排除基线前已诊断者。年龄限制为32-70岁。图中还显示了各研究中13种疾病的病例数,膝骨关节炎病例最多,肺癌最少。
核心亮点
亮点 1|PheRS与13种疾病显著相关
所有PheRS均与目标疾病显著相关(P<0.05),其中痛风(HR=1.59)、2型糖尿病(HR=1.49)和肺癌(HR=1.46)关联最强。在基线模型(年龄+性别)中加入PheRS后,7种疾病(哮喘、抑郁症、2型糖尿病、膝骨关节炎、髋骨关节炎、痛风、房颤)的c-index显著提升。即使加入教育水平和Charlson合并症指数,哮喘、抑郁症、2型糖尿病和膝骨关节炎的改善仍然显著。

图 2 Fig. 2。图2a显示PheRS与疾病发病风险的关联,所有疾病HR均显著大于1,痛风、2型糖尿病和肺癌的HR最高。图2b比较了基线模型与加入PheRS后的c-index,多数疾病点位于对角线上方,表明预测准确性提升,其中抑郁症、痛风、癫痫和哮喘的改善在meta分析中显著。
亮点 2|PheRS跨生物库通用性良好
外部训练的PheRS与内部训练的PheRS平均相关系数为0.43(范围-0.05至0.76)。大多数外部训练的PheRS在FinnGen中仍与疾病显著相关,并改善c-index。例如,在EstB中,来自UKB的PheRS对髋骨关节炎、痛风和膝骨关节炎的风险比并未显著低于内部模型。尽管内部模型通常表现更好,但外部模型的性能下降有限,表明PheRS捕获了跨医疗系统一致的风险信号。

图 3 Fig. 3。图3a显示内部与外部训练PheRS的相关性,大多数疾病相关系数在0.2-0.6之间,但乳腺癌和结直肠癌相关性低。图3b比较了内部与外部训练PheRS的HR,外部模型的HR通常较低,但多数仍显著,表明跨研究通用性存在但有所衰减。
亮点 3|Phecode重要性因研究而异
三个研究中phecode的流行率差异显著,仅48个phecode在所有研究中流行率≥1%。例如,EstB包含初级保健数据,导致33%的phecode为该研究独有。然而,一些关键预测因子如高血压(401)、超重(278)、酒精滥用(317)和周围神经疾病(351)在所有研究中均常见且效应一致。对于抑郁症,酒精滥用是三个研究中一致的重要预测因子,而烟草使用障碍仅在UKB中重要。弹性网络允许多个相关phecode具有非零系数,缓解了编码差异的影响。

图 4 Fig. 4。图4a的Venn图显示三个研究中phecode的重叠情况,仅48个phecode在所有研究中流行率≥1%。图4b展示了示例phecode的流行率差异,图4c显示各研究中PheRS系数的中位数分布,图4d以抑郁症为例展示了共享和特异的预测因子。
亮点 4|PheRS与PGS正交且互补
PheRS与PGS的平均相关系数仅为0.02(范围0.00-0.08),表明两者捕获的信息几乎独立。在PGS模型中加入PheRS后,FinnGen中9/13种疾病、UKB中2/4种疾病、EstB中6/13种疾病的c-index显著提升。反之,在PheRS模型中加入PGS也带来显著改善。对于8/13种疾病,PheRS在识别高风险个体(前10%)方面优于PGS,尤其在2型糖尿病、痛风、肺癌、哮喘、抑郁症、癫痫、髋骨关节炎和膝骨关节炎中。

图 5 Fig. 5。图5a左图比较了PheRS和PGS对疾病风险的HR,对于8种疾病,PheRS的HR高于PGS。右图显示在调整PGS后,PheRS的HR变化不大,表明两者独立。图5b显示PheRS与PGS的相关性极低,进一步支持正交性。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 弹性网络、Cox比例风险模型、phecode映射、PGS、跨生物库验证
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事疾病风险预测、EHR数据挖掘或多基因评分研究的生物信息学与流行病学研究者。
带走一句
EHR诊断史与遗传信息互补,联合使用可提升多种疾病风险预测,且PheRS跨医疗系统可转移,为临床整合提供依据。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。