IF50.5|49万英国生物银行全基因组测序揭示罕见变异与疾病关联
WGS捕获远超WES和芯片的变异,发现新关联并提升精细定位。
WGS捕获远超WES和芯片的变异,发现新关联并提升精细定位。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
英国生物银行(UKB)是一项大规模人群队列研究,收集了49万参与者的基因型和丰富表型数据。此前,UKB已对全部样本进行SNP芯片基因分型并填补至约9600万个常见变异,并对部分样本进行了全外显子组测序(WES),覆盖约2-3%的基因组。然而,芯片和WES均无法全面捕获罕见变异、非编码区变异和结构变异(SV)。已知罕见非编码变异在人类疾病和复杂性状中发挥重要作用,但相关研究仍十分有限。随着测序成本下降,大规模全基因组测序(WGS)成为可能,为系统探索人类基因组变异及其与疾病的关系提供了前所未有的机会。
科学问题
卡在哪里: 此前UKB的遗传数据主要基于芯片和WES,无法全面检测罕见变异、非编码区变异和结构变异。WES仅覆盖外显子区域,遗漏了大部分UTR变异和部分编码区变异,且对SV的检测能力有限。因此,UKB中大量罕见非编码变异和SV与表型的关联尚未被探索。
本文要回答: 本文旨在描述和表征UKB 49万参与者的WGS数据集,并展示其在发现新遗传关联、改进精细定位、识别功能丧失变异和结构变异等方面的独特价值。
技术路线
作者主要用了:全基因组测序、GraphTyper联合变异检测、DRAGEN单样本变异检测、跨种族荟萃分析、罕见变异负荷分析。
作者对490,640名UKB参与者进行平均32.5×深度的全基因组测序,采用GraphTyper和DRAGEN两种流程进行变异检测,并利用长读长测序和组装数据辅助SV鉴定。随后,基于gnomAD训练的分类器将个体划分为五个主要祖先群体。在表型关联分析中,作者进行了单变异GWAS、跨种族荟萃分析、基因负荷分析(包括编码区和UTR区)以及SV关联分析,以全面评估WGS数据在遗传发现中的增益。

图 1 Fig. 1。图1展示了不同祖先群体中每个个体检测到的变异数量分布。非洲祖先个体检测到的变异最多,其次是东亚、南亚、德系犹太和欧洲祖先。此外,图1b显示结构变异缺失的长度随频率降低而增加,罕见缺失的中位长度(1,660bp)远大于常见缺失(169bp),表明罕见结构变异往往更大。
核心亮点
亮点 1|WGS变异数量远超WES和芯片
WGS共鉴定出约15亿个变异(SNP、indel和SV),相比芯片填补数据集增加了18.8倍,相比WES增加了超过40倍。在编码区,WGS捕获了WES遗漏的13.7%的变异;在UTR区,WES遗漏了69.2%的5'UTR和89.9%的3'UTR变异。此外,WGS还发现了大量罕见变异,其中76.3%的SV由少于10个个体携带。这些数据表明WGS在全面捕获人类基因组变异方面具有显著优势。

图 2 Fig. 2。图2展示了跨种族荟萃分析中全基因组显著关联的数量。大多数关联在欧洲祖先分析中也显著,但有82个关联仅在非欧洲祖先分析中显著,且部分关联在非欧洲祖先中信号更强。这表明跨种族分析能够发现祖先特异性的遗传关联。
亮点 2|跨种族荟萃分析揭示祖先特异性关联
跨种族荟萃分析共发现28,674个全基因组显著关联,其中126个在非欧洲祖先中信号更强。例如,HBB基因的rs334(镰状细胞病致病变异)在非洲祖先中频率高达14.7%,而在欧洲祖先中仅0.005%;G6PD的rs1050828在非洲祖先中频率为14.7%,与网织红细胞和胆红素水平升高相关。这些发现凸显了在多样化人群中进行遗传研究的重要性。

图 3 Fig. 3。图3比较了WGS和WES数据集中携带功能丧失(pLoF)、致病或可能致病变异的基因携带者数量。对于携带者超过100人的基因,WGS数据集中的中位携带者数量比WES多44人,说明WGS在检测高影响变异方面具有更高的灵敏度。
亮点 3|WGS提升基因负荷分析效能
在460,552名同时具有WES和WGS数据的个体中,作者进行了基因负荷PheWAS。共发现1,359个显著基因-表型关联,其中105个仅在WGS中显著,66个仅在WES中显著。WGS在PKHD1等基因上显示出更高的覆盖度和更显著的关联。此外,WGS还发现了WES遗漏的ClinVar致病变异,如CALR基因的52bp缺失,该变异与血小板宽度显著相关(效应2.02 s.d.,P=3.1×10^-38)。

图 4 Fig. 4。图4展示了基于UTR的罕见变异负荷PheWAS的曼哈顿图。图中显示了687个二元表型(上)和64个定量表型(下)的关联结果。不同颜色代表5'UTR、3'UTR及两者组合的显著关联。多个基因-表型关联达到全基因组显著水平,表明UTR变异在疾病易感性中具有重要作用。
亮点 4|UTR罕见变异负荷分析发现新关联
作者利用WGS数据对5'UTR、3'UTR及两者组合进行了罕见变异负荷PheWAS,共发现63个显著关联(1个二元表型,62个定量表型),涉及32个基因和37个表型。其中51%的关联在蛋白编码区负荷分析中也显著,83%在500kb内有常见变异关联。此外,将UTR变异与蛋白截短变异结合后,发现了10个仅在此模型中显著的关联,如NWD1与肾结石的关联(P=7.53×10^-7,OR=1.63),主要由3'UTR变异驱动。
亮点 5|结构变异关联分析揭示临床相关发现
WGS鉴定出2,739,152个SV,其中1,926,132个可靠。作者发现多个与疾病相关的SV,如PCSK9基因的14,154bp缺失与低非HDL胆固醇相关;MIP基因的5,200bp缺失与白内障相关(OR=25.3,P=6.3×10^-7);CALR基因的52bp缺失与血小板宽度相关;NEB基因的2,502bp缺失与线状肌病相关;HBB基因的613bp缺失与β-地中海贫血相关。这些SV大多未被WES捕获,凸显了WGS在SV检测中的价值。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 全基因组测序、GraphTyper联合变异检测、DRAGEN单样本变异检测、跨种族荟萃分析、罕见变异负荷分析
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事人类遗传学、基因组学、生物信息学及药物研发的研究人员。
带走一句
WGS数据能显著提升罕见变异和结构变异的检测能力,建议在遗传关联研究中优先采用WGS,并关注非编码区和结构变异。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。