IF50.5|65个多样化人类基因组近完整组装揭示复杂遗传变异
130个单倍型组装攻克复杂位点,大幅提升短读长测序基因分型能力。
130个单倍型组装攻克复杂位点,大幅提升短读长测序基因分型能力。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
长读长测序技术推动了首个完整人类基因组的完成,并显著提高了结构变异(SV)的检测灵敏度。结合Hi-C、Strand-seq或家系数据,已能组装出高质量的二倍体基因组,并构建了首个草稿人类泛基因组参考。然而,在着丝粒、大片段重复等遗传复杂区域仍存在缺口,导致部分蛋白编码基因缺失。此前HGSVC对32个人类基因组的组装中,大多数着丝粒和超过一半的大片段重复不完整。要闭合这些缺口,需要结合PacBio HiFi和超长ONT读长的互补优势,并借助Verkko、hifiasm等算法。本研究旨在对65个多样化人类个体进行测序和组装,以获得近乎无缺口的染色体,包括着丝粒和复杂片段重复。
科学问题
卡在哪里: 尽管长读长组装已取得进展,但着丝粒、Yq12异染色质区、大片段重复等复杂位点仍难以完整组装和评估,导致部分基因缺失,且现有泛基因组参考对复杂结构变异的表征不足。
本文要回答: 对65个多样化人类基因组进行高质量单倍型组装,系统解析复杂结构变异,并评估其对基因分型和疾病关联研究的提升作用。
技术路线
作者主要用了:PacBio HiFi、ONT超长、Strand-seq、Hi-C、Iso-Seq、RNA-seq、Verkko、hifiasm。
作者选取65个来自5个大陆群体、28个群体的个体,生成约47×PacBio HiFi和56×ONT(含36×超长)测序数据,并辅以Strand-seq、Bionano、Hi-C、Iso-Seq和RNA-seq。利用Verkko进行单倍型分型组装,并以Graphasing整合Strand-seq进行全局定相,获得130个单倍型组装。随后用hifiasm补充着丝粒和Yq12区域。基于组装结果,使用PAV等多工具进行变异检测,并整合到泛基因组图中,用PanGenie对3202个1kGP个体进行基因分型,评估短读长数据重建个人基因组的能力。

图 1 Fig. 1。图1展示了65个样本的群体分布和组装质量。a图显示样本覆盖5个大陆群体和28个群体,包括新增的MKK和ASK。b图显示每个单倍型的scaffold auN,中位约137 Mb,表明组装连续性高。c图显示碱基准确度中位QV在54-57之间。d-e图显示602条染色体为T2T无缺口,559条为单scaffold。f图显示相对于T2T-CHM13检测到188,500个SV、630万indels和2390万SNV。g图显示每个单倍型平均有7772个SV插入和7745个SV缺失。
核心亮点
亮点 1|组装质量与连续性
130个单倍型组装的中位auN达137 Mb,碱基准确度中位QV在54-57之间,单拷贝基因完整度中位99%,闭合了此前HiFi-only组装中92%的缺口。602条染色体实现端粒到端粒无缺口组装,另有559条为单scaffold。通过Flagger、Merqury等工具进行错误注释,估计99.6%的定相序列组装正确。三个家系中,子代组装中>100 kb的contig有99.9%得到亲本支持。

图 2 Fig. 2。图2展示了Y染色体结构和功能影响。a图显示Y染色体结构,包括着丝粒和Yq12异染色质区,以及5个连续组装的Yq12区域的重复组成和系统发育关系。b图显示Iso-Seq读长比对到本研究组装体的比例高于T2T-CHM13,表明组装体更完整。c图展示ZNF718基因因一个6142 bp缺失产生9种独特异构体。d图显示PanGenie基因分型检测到的稀有SV数量远高于HPRC和1kGP-HC。e图显示个人基因组重建的QV中位数为45,高于1kGP-HC的43。f图显示扩展参考面板后,单倍型可用性从39.6%提升至51.5%。
亮点 2|复杂位点完整解析
成功组装并验证了1246个人类着丝粒,发现α-卫星HOR阵列长度变异高达30倍,并鉴定了4153个新的HOR变异。在MHC区域,解析了826个不完整的HLA等位基因注释,包括112个HLA-DRB序列,并发现了170个参考单倍型中不存在的SV。在SMN区域,101个单倍型被完全解析,区分了功能性SMN1和SMN2拷贝。在淀粉酶基因座,鉴定了39种单倍型,包括最大的H11.1(11个AMY1拷贝)。

图 3 Fig. 3。图3展示了MHC区域的详细解析。a图显示MHC分为I、II、III类区域,并标出结构可变区域。b图显示HLA-DR区域中孤立HLA-DRB外显子1和内含子1序列的分布,按DR组分类。c图显示高分辨率重复图谱和基因转换事件,支持DR8和DR1的起源模型。d图展示RCCX模块的不同单倍型结构,包括单模块、双模块和三模块,以及C4和CYP21A2的拷贝数变异。e图显示基于PGR-TK的多尺度聚类完美重现了传统DR组系统,并揭示了更细的亚组。
亮点 3|Y染色体与Yq12异染色质
30个男性个体中,7个(23%)的男性特异区无缺口组装,其中4个为新的完整Y染色体,代表E1b1a、R2a和R1b1a谱系。Yq12区域长度在17.85-37.39 Mb之间,DYZ1和DYZ2重复阵列的数量和长度高度可变。利用四个独特的Alu插入,追踪了Yq12区域的进化动态,例如在NA19239中观察到串联重复事件。

图 4 Fig. 4。图4展示了复杂结构变异和重要基因座。a图显示一个SD介导的CSV,倒位NBPF8并删除NOTCH2NLR和NBPF26,PAV改进了大重复区域的比对。b图显示不同研究中SMN区域完整组装的占比,本研究显著提高。c图显示SMN1/2、SERF1A/B、NAIP和GTF2H2/C的拷贝数分布。d图展示11个单倍型的复杂结构。e图显示98个单倍型携带祖先SMN1拷贝,3个不携带。f图展示淀粉酶基因座的39种单倍型,长度从111 kb到582 kb不等,其中H11.1含11个AMY1拷贝。
亮点 4|短读长基因分型提升
将65个HGSVC基因组与42个HPRC基因组结合构建泛基因组图,用PanGenie对3202个1kGP个体进行基因分型,平均每个基因组检测到26115个SV,远高于HPRC的18462个和1kGP-HC的9596个。稀有SV(AF<1%)数量显著增加,非洲个体平均1490个,非非洲个体362个。个人基因组重建的中位k-mer QV达45,高于1kGP-HC的43。在复杂位点,Locityper使用扩展参考面板后,预测准确率从74.6%提升至80.0%。

图 5 Fig. 5。图5展示了着丝粒的遗传和表观遗传变异。a图显示每个基因组中活性α-卫星HOR阵列的长度,中位约2.3 Mb,但变异很大。b图显示着丝粒的序列、结构和甲基化图谱,包括染色体1、6、10、12、19等的不同HOR组织。c图显示染色体19着丝粒的序列一致性热图,CDR位于高一致性区域。d图显示染色体2着丝粒D2Z1阵列中MEI的分布,L1HS和Alu插入富集。
亮点 5|着丝粒表观遗传与MEI
所有着丝粒均含至少一个低甲基化区域(CDR),但约7%的染色体存在两个相距>80 kb的CDR,提示可能存在双着丝粒。CDR通常位于α-卫星HOR阵列中序列一致性最高的区域。约30%的α-卫星HOR阵列含有至少一个MEI,共鉴定89个独特多态性插入,以L1HS为主(58%),其次为Alu(41%)。D2Z1阵列在80%的单倍型中含有L1HS和/或Alu插入。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: PacBio HiFi、ONT超长、Strand-seq、Hi-C、Iso-Seq、RNA-seq、Verkko、hifiasm
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事人类基因组结构变异、泛基因组构建、复杂疾病遗传学研究的科研人员。
带走一句
高质量单倍型组装能显著提升短读长数据的基因分型能力,尤其在复杂位点和稀有SV检测上,为疾病关联研究提供更完整的变异集合。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。