周启涛生物技术工作室
基因组与遗传2025/04/09· 编译自 Nature

IF50.5|六种猿类T2T基因组完成测序与比较分析

首个猿类端粒到端粒基因组资源,揭示高度重复区域的进化新图景。

首个猿类端粒到端粒基因组资源,揭示高度重复区域的进化新图景。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

自2001年人类基因组草图发布以来,高质量猿类基因组测序一直是人类遗传学与基因组学领域的优先任务。猿类基因组对于重建人类基因组每个碱基的进化历史至关重要。然而,由于猿类基因组富含重复序列,此前的参考基因组始终未能完整组装,尤其是着丝粒、端粒、片段重复和异染色质等动态区域。近年来,长读长测序技术和新组装算法的发展使得人类T2T基因组成为可能,但猿类基因组仍存在大量缺口。

科学问题

卡在哪里: 此前所有猿类参考基因组均存在大量缺口,尤其是着丝粒、端粒、片段重复和异染色质等高度重复区域。这些区域往往包含谱系特异性基因家族和快速进化的调控元件,但由于组装困难而被排除在比较研究之外,导致我们对人类近亲的进化理解不完整,并引入人类参考基因组偏倚。

本文要回答: 生成六种猿类(黑猩猩、倭黑猩猩、大猩猩、婆罗洲猩猩、苏门答腊猩猩、合趾猿)的单倍型解析T2T参考基因组,并利用这些完整基因组进行无偏比较分析,揭示此前无法研究的重复区域的进化规律。

技术路线

作者主要用了:PacBio HiFi、ONT超长读长、Hi-C、Verkko组装、比较基因组学

作者选取雄性个体以同时获得X和Y染色体,利用PacBio HiFi(平均90×)和ONT超长读长(平均136.4×,其中>100 kb超长读长至少30×)测序,结合Hi-C或家系数据,使用Verkko混合组装器构建单倍型解析的二倍体基因组。对每个染色体选择最完整准确的单倍型作为初级组装,并通过多种方法评估组装质量。随后构建猿类泛基因组,进行基因注释、重复序列注释、结构变异分析、选择信号检测以及着丝粒、端粒、acrocentric染色体等特定区域的深入比较。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了HSA7和HSA16与五种猿类同线染色体的比对,用SVbyEye可视化共线性区域(蓝色)和倒位区域(黄色)。图中可见大猩猩、倭黑猩猩等谱系特异的卫星扩增导致亚端粒异染色质长度差异显著,直观体现了重复序列在猿类基因组中的动态变化。

核心亮点

亮点 1|215条染色体实现T2T无缺口组装

在六种猿类的二倍体基因组中,74%(215/290)的染色体达到端粒到端粒无缺口组装,至少80.8%的染色体在至少一个单倍型上实现T2T。平均每个单倍型仅有6个缺口,主要位于rDNA阵列。组装准确度估计为QV 49.3-61.7(约每10万至100万碱基1个错误),99.2-99.9%的基因组被完整准确组装。该资源已被NCBI采纳为参考基因组,替换了此前不完整的版本。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2a显示各谱系特异的结构差异区域(SDR)数量,平均每谱系327 Mb(10%),包括着丝粒、acrocentric短臂和亚端粒帽。图2b展示物种分化时间和有效群体大小,人类-黑猩猩分化约5.5-6.3 Ma,非洲猿祖先Ne约132,000。图2c和2d分别显示Alu/L1插入和ERV元件的谱系差异,猩猩L1活性高而非洲猿Alu积累多。

亮点 2|猿类泛基因组揭示更多祖先序列

利用Progressive Cactus构建包含人类和猿类单倍型的泛基因组,其复杂度远高于人类泛基因组(3.38 Gb,边和节点数约为人类泛基因组的3倍)。基于该泛基因组,对GRCh38的祖先注释碱基数增加了6.25%,其中19号染色体增加最多(21.5%)。此外,通过全对全比对构建隐式图并计算phastCons保守分数,识别出各谱系中进化最快的区域,包括MHC和8p23.1倒位。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a-c展示大猩猩18号染色体上4.8 Mb倒位转座的比对图和FISH验证,证明该事件由三次连续倒位造成。图3d-e显示猩猩2号染色体(对应人类3号染色体)的复杂重排模型,需要多次倒位和着丝粒重定位。这些结果说明大规模染色体重排往往比简单倒位更复杂。

亮点 3|结构变异与倒位事件的新解析

在序列水平确认了所有26个已知的区分人类与其他猿类的大规模染色体重排,并发现其中一些事件比原先认为的更复杂。例如,大猩猩18号染色体上4.8 Mb的倒位转座实际上是三次连续倒位的结果;猩猩2号染色体(对应人类3号染色体)的形成需要三次倒位和一次着丝粒重定位。此外,新发现522个>10 kb的种间倒位,其中63.5%的倒位断点处富集片段重复,提示非等位同源重组是主要机制。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4a左图显示HAQER在人类T2T组装中比gapped组装识别更多,且显著富集二价调控元件;右图显示其他猿类AQER的二价富集较弱。图4b以ADCYAP1为例,展示人类特异的HAQER与第5层神经元中基因表达下调和表观遗传差异相关,提示HAQER可能参与人类特异性状。

亮点 4|人类加速进化区域HAQER数量翻倍

利用无缺口的猿类基因组,识别出13,128个祖先快速进化区域(AQER),其中人类分支上的HAQER数量从之前的1,581个增加到3,268个,翻了一倍多。HAQER显著富集于二价染色质状态(尤其是二价启动子,3倍富集),且这种富集在人类中强于其他猿类。一个例子是ADCYAP1基因,其人类特异的HAQER与第5层投射神经元中的表达下调和表观遗传差异相关,可能涉及语言运动皮层的进化。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5a展示HSA22两个单倍型短臂的序列相似性热图和卫星注释,显示rDNA阵列和卫星重复的排列。图5b总结各物种NOR+染色体的分布和rDNA拷贝数,猩猩和合趾猿Y染色体上存在NOR。图5c-d显示acrocentric短臂的卫星组成和跨物种同线性急剧下降,支持异源重组驱动的协同进化。

亮点 5|倭黑猩猩存在微型着丝粒

对五种非人灵长类着丝粒的分析发现,倭黑猩猩的α卫星HOR阵列长度呈双峰分布:约一半着丝粒(27/48)平均长度仅110 kb(范围15-674 kb),另一半平均3.6 Mb(范围1.6-6.7 Mb)。这种超过450倍的变异在其他灵长类中未见。这些微型着丝粒具有明确的CDR(着丝粒甲基化低谷),表明其功能完整。这一发现为设计更小的人工染色体提供了思路。

亮点 6|亚端粒异染色质帽的独立进化

成功组装了黑猩猩、倭黑猩猩、大猩猩和合趾猿的亚端粒异染色质帽,总长1.05 Gb(占基因组4-10%)。这些帽由pCht卫星阵列和间隔序列组成,间隔序列约30 kb,在帽内呈现低甲基化,两侧为高甲基化卫星。间隔序列起源于祖先片段重复,在不同谱系中独立整合并扩增。这种低甲基化口袋可能作为蛋白质结合位点或促进异位交换,类似于着丝粒的CDR。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: PacBio HiFi、ONT超长读长、Hi-C、Verkko组装、比较基因组学
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事灵长类进化、比较基因组学、重复序列或结构变异分析的研究者。

带走一句

T2T基因组消除了参考偏倚,使重复区域的进化分析成为可能;做比较基因组学时,应优先使用完整组装而非映射到人类参考。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。