IF50.5|台湾精准医学计划:50万华人队列的遗传与电子病历整合
TPMI纳入56.5万参与者,整合基因型和电子病历,为东亚人群精准医学提供大规模资源。
TPMI纳入56.5万参与者,整合基因型和电子病历,为东亚人群精准医学提供大规模资源。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
精准医学旨在根据个体特征定制医疗干预,但全球大型遗传研究多集中于欧洲血统人群,导致非欧洲人群的疾病风险预测和药物反应评估效果不佳。汉族占全球人口近20%,却缺乏大规模、整合遗传与临床数据的队列。台湾地区医疗体系完善,电子病历系统覆盖率高,且人群遗传背景相对同质,具备建立大型队列的条件。此前已有台湾生物库(TWB)等资源,但样本量和临床数据深度有限。TPMI由中央研究院联合16家医学中心建立,旨在填补这一空白,通过大规模招募、定制SNP芯片和电子病历整合,为汉族人群的遗传关联研究、多基因风险评分和药物基因组学提供基础。
科学问题
卡在哪里: 现有大型生物库多基于欧洲血统人群,东亚人群的遗传结构、疾病相关变异和风险预测模型存在差异。台湾虽有TWB等队列,但样本量相对较小,且缺乏与电子病历的深度整合,难以支持大规模表型组关联研究和纵向随访。此外,台湾人群包含汉族与多个原住民族群的遗传混合,其精细结构尚未被充分解析,限制了遗传关联分析的准确性。
本文要回答: 建立大规模汉族血统队列,整合基因型与电子病历数据,解析台湾人群遗传结构,并验证其在全基因组关联研究和多基因风险评分中的应用价值。
技术路线
作者主要用了:定制SNP芯片、全基因组关联分析、多基因风险评分、主成分分析、ADMIXTURE、ChromoPainter。
研究团队从16家医学中心招募参与者,采集血液样本进行定制SNP芯片基因分型,同时获取电子病历数据。基因型数据经质控和填补后,与外部参考面板(如TWB、1KGP)进行主成分分析和遗传混合分析,以解析人群结构。随后,利用该队列开展2型糖尿病、高血压等疾病的GWAS,并与东亚及欧洲生物库结果比较。最后,构建多基因风险评分模型,评估其在疾病预测中的表现。

图 1 Fig. 1。图1展示了TPMI的16家合作医学中心和33家附属医院的地理分布,以及各中心的DNA样本数、基因分型样本数、接收电子病历的个体数和同时具有基因型与电子病历的个体数。图中可见不同中心贡献差异较大,反映了招募策略和医院规模的差异。
核心亮点
亮点 1|队列规模与临床数据覆盖
TPMI招募了565,390名参与者,其中486,956人同时具有基因型和电子病历数据。参与者平均年龄约56岁,女性占55.3%。电子病历包含门诊、住院、检验、病理等记录,其中25万人有5年以上随访,7.3万人有10年以上随访。最常见的疾病包括脂蛋白代谢紊乱(30.3%)、原发性高血压(21.0%)、2型糖尿病(18.3%)。实验室数据中,肌酐检测覆盖68.3%的参与者。亲属关系分析显示70.9%的参与者能找到三级以内亲属,提示需采用混合模型处理样本相关性。

图 2 Fig. 2。图2a显示性别特异的年龄分布,男性平均57.4岁,女性平均54.9岁,年龄范围20-90岁,包含160余位百岁老人。图2b列出前20位ICD-10疾病患病率,E78(脂蛋白代谢紊乱)最高(30.3%),且多数疾病存在性别差异。图2c显示各疾病平均发病年龄,J30(血管运动性和过敏性鼻炎)最早(49.4岁),N40(前列腺增大)最晚(65.5岁)。图2d显示常见实验室检查的覆盖率,肌酐最高(68.3%)。图2e展示亲属关系分布,70.9%参与者有三级以内亲属。
亮点 2|台湾人群的精细遗传结构
主成分分析显示,第一主成分区分汉族与原住民族群,第二主成分与纬度相关,反映南北汉族差异。ADMIXTURE分析支持K=10个祖先群体,其中K1-K2为汉族富集,K3-K6为原住民富集,K7-K10对应全球移民。共祖分析揭示汉族与原住民之间存在有限的单倍型共享,表明长期分化。原住民亚群内部异质性较高,K4和K5表现出更强的漂变和奠基者效应。此外,原住民及非东亚血统个体纯合度更高,提示其有效群体较小。

图 3 Fig. 3。图3a主成分分析显示TPMI与TWB重叠,但TPMI包含更多原住民和混合个体。1950年前出生者分布较集中,之后出生者更分散,反映族群通婚。ADMIXTURE分析显示K1-K2为汉族富集,K3-K6为原住民富集,K7-K10为全球移民。图3b共祖热图显示汉族与原住民之间单倍型共享有限,原住民内部存在亚结构。图3c为最佳拟合的混合图,支持汉族与原住民的分化及近期混合事件。
亮点 3|新发现的2型糖尿病相关位点
TPMI的2型糖尿病GWAS(52,290例病例,192,817例对照)鉴定出多个在东亚及欧洲生物库中未达全基因组显著的新位点,涉及HLA-DQB1、C2、VWA7、MSH5-SAPCD1等基因。功能富集分析显示这些基因富集于糖尿病、心血管疾病、代谢和炎症通路。与日本生物库(BBJ)、中国慢性病前瞻性研究(CKB)、韩国基因组流行病学研究(KoGES)和英国生物库(UKB)的比较表明,部分关联信号具有人群特异性,反映了等位基因异质性和连锁不平衡差异。

图 4 Fig. 4。图4a比较TPMI与BBJ、CKB、KoGES、UKB的2型糖尿病GWAS结果,列出TPMI独有且在其他生物库中未达全基因组显著的新SNP。图4b展示两两比较,不同生物库间效应方向大多一致,但部分位点存在异质性。新位点涉及HLA区域和多个基因,提示人群特异性遗传效应。
亮点 4|多基因风险评分预测2型糖尿病
基于DIAGRAM联盟多祖先GWAS汇总统计,使用PRS-CSx构建的2型糖尿病多基因风险评分在训练和测试集中AUC均为0.65。加入年龄、性别和BMI后,AUC提升至0.86。PRS与疾病风险呈剂量反应关系,最高十分位组相比最低十分位组的比值比显著升高。另一基于PGS Catalog的评分(PGS002308)表现相似。该结果支持PRS在东亚人群中识别高风险个体、指导早期干预的潜力。

图 5 Fig. 5。图5a显示PRS单独预测2型糖尿病的AUC为0.65,加入年龄、性别和BMI后AUC升至0.86。图5b展示PRS十分位与2型糖尿病比值比的剂量反应关系,随着PRS升高,风险单调增加,且加入协变量后区分度更好。误差线表示95%置信区间。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 定制SNP芯片、全基因组关联分析、多基因风险评分、主成分分析、ADMIXTURE、ChromoPainter
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事东亚人群遗传关联研究、多基因风险评分建模或精准医学队列设计的研究者。
带走一句
大规模东亚人群队列结合电子病历和定制芯片,能发现欧洲人群中缺失的疾病关联位点,并提升多基因风险评分在东亚人群中的预测效能。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。