IF31.7|两株小鼠T2T基因组揭示端粒与着丝粒结构多样性
首个C57BL/6J与CAST/EiJ端粒到端粒基因组,补全213 Mb新序列,解析端粒与着丝粒结构变异。
首个C57BL/6J与CAST/EiJ端粒到端粒基因组,补全213 Mb新序列,解析端粒与着丝粒结构变异。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
小鼠是哺乳动物疾病研究的重要模型,C57BL/6J参考基因组自2002年发布以来极大推动了生物医学研究。然而,当前参考基因组GRCm39仍不完整,存在281个染色体序列缺口,缺少端粒和着丝粒,许多生物医学相关位点仅部分代表。端粒和着丝粒是维持染色体稳定性和完整性的关键结构,但由于其高度重复性,传统测序技术难以解析。近年来,超长读长测序技术的发展使得人类端粒到端粒(T2T)基因组组装成为可能,为完整解析复杂重复区域提供了新机遇。
科学问题
卡在哪里: GRCm39参考基因组仍存在281个缺口,缺乏完整的端粒和着丝粒序列,且许多重要位点(如假常染色体区PAR和KRAB锌指蛋白簇)不完整。端粒和着丝粒的序列组成和结构变异在近交系小鼠中尚未被系统解析,限制了对其功能和进化的理解。
本文要回答: 利用超长读长测序技术,构建C57BL/6J和CAST/EiJ两个近交系小鼠的端粒到端粒完整基因组,解析端粒和着丝粒的结构多样性,并补全参考基因组中的缺口和重要位点。
技术路线
作者主要用了:PacBio HiFi、Oxford Nanopore超长测序、trio-binning组装、Verkko、Hifiasm、RNA-seq、RepeatMasker、SyRI。
作者从CAST/EiJ×C57BL/6J F1雄性胚胎干细胞提取DNA,结合PacBio HiFi(188×)和Oxford Nanopore超长测序(70×),采用trio-binning策略分离亲本单倍型。利用Verkko和Hifiasm生成多个组装版本,通过k-mer完整性、单倍型分离度和端粒存在等指标筛选最佳组装。随后进行人工校正和抛光,并利用Hi-C和MashMap将未定位的端粒着丝粒序列分配到染色体。最终获得两个T2T基因组,并基于RNA-seq数据进行基因注释。

图 1 Fig. 1。图1展示GRCm39、T2T C57BL/6J和T2T CAST/EiJ三者的全基因组共线性比较。T2T基因组在每条染色体末端都标注了端粒和着丝粒,而GRCm39仅在少数常染色体非着丝粒端有端粒。图中可见GRCm39中的缺口被填补,以及C57BL/6J与CAST/EiJ之间的大规模倒位。右侧柱状图显示T2T基因组中卫星序列和常见重复类别相对GRCm39的显著增加。
核心亮点
亮点 1|T2T基因组新增213 Mb序列
与GRCm39相比,T2T C57BL/6J和CAST/EiJ分别新增208 Mb和247 Mb常染色体序列,总计新增213.2 Mb和252.1 Mb。新增序列主要由卫星DNA和转座子等重复序列组成,卫星序列总量增加超过31倍。基因注释显示,C57BL/6J和CAST/EiJ分别预测到21,423和21,440个蛋白编码基因,其中225和355个为新基因,且许多新基因与锌指蛋白等已知蛋白有显著同源性。此外,与GRCm39相比,C57BL/6J和CAST/EiJ中分别有94和205个基因拷贝数增加,如Duxf3和Potefam3a等。

图 2 Fig. 2。图2比较了两个T2T基因组的着丝粒端部结构。a显示每条染色体上着丝粒区域的重复注释,可见主要卫星和次要卫星的分布。b展示亚端粒区(TLC端)结构,C57BL/6J具有保守的L1-LINE→TLC重复→次要卫星模式,而CAST/EiJ则高度异质。c和d的箱线图显示着丝粒区域总长度和主要/次要卫星长度的分布,CAST/EiJ的变异范围更大。
亮点 2|端粒与着丝粒结构高度可变
两个T2T基因组首次完整呈现了小鼠端粒和着丝粒。小鼠染色体为端部着丝粒(TLC),着丝粒由次要卫星和主要卫星组成。C57BL/6J和CAST/EiJ的主要卫星总长分别为200.07 Mb和223.7 Mb,次要卫星为13.07 Mb和16.5 Mb。着丝粒区域总长度在C57BL/6J中位数为11.1 Mb,CAST/EiJ为12.9 Mb,且CAST/EiJ的分布更广(5-35 Mb vs 5-25 Mb)。TLC端部结构在C57BL/6J中高度保守,存在L1-LINE→TLC重复→次要卫星的典型模式,而CAST/EiJ则高度异质,含有CenSat重复和更复杂的重复阵列。

图 3 Fig. 3。图3展示GRCm39缺口在T2T C57BL/6J中的填充情况。a显示每条染色体上缺口的状态(完全填充、部分填充、未填充)。b为缺口填充序列中预测的蛋白编码基因数量和PANTHER蛋白类别分布。c以chr1上一个50 kb缺口为例,显示其在T2T C57BL/6J中扩展为4.1 Mb,在CAST/EiJ中为7.1 Mb,并存在复杂重排。
亮点 3|补全参考基因组缺口并发现免疫基因扩增
T2T C57BL/6J组装完全跨越了GRCm39中92%的常染色体缺口(80/87),引入约12.7 Mb新序列。在这些缺口填充序列中鉴定出190个蛋白编码基因,功能富集于跨膜信号受体等类别。例如,chr1上一个50 kb的缺口在T2T C57BL/6J中扩展为4.1 Mb,在CAST/EiJ中为7.1 Mb,该区域富含Speckled蛋白基因家族(Sp100、Sp110、Sp140),其中Sp140在CAST/EiJ中有35个拷贝,而C57BL/6J中为16个,提示免疫相关基因的拷贝数变异。

图 4 Fig. 4。图4聚焦倒位分析。a比较了GRCm39、C57BL/6J和CAST/EiJ的PAR位点,显示PAB位置差异。b和c通过置换检验展示倒位断点处重复序列的富集情况,LINE/LTR富集在断点附近迅速衰减,而SD富集延伸更远。d显示不同重复类型介导的NAHR倒位比例。e显示SD相关倒位更长。f和g展示大于1 Mb的倒位及其断点处的重复结构。
亮点 4|倒位断点富集重复序列
通过比较T2T组装,鉴定出133个大于1 kb的倒位。倒位断点显著富集片段重复(SD)、LINE和LTR逆转座子(置换检验,P<0.001)。LINE和LTR的富集在断点附近迅速衰减,而SD的富集延伸数百kb。约60%的倒位显示NAHR特征,其中约50%与LINE相关,21%与LTR相关,15%与SINE相关,11%与SD相关。SD相关的倒位长度显著更长(MWU,P<0.001),且SD长度与倒位长度正相关(Kendall’s τ=0.63,P=0.0007),提示大重复序列促进大片段结构重排。

图 5 Fig. 5。图5展示KZFP簇的共线性图。a-c分别为chr2、chr4和chr17上的KZFP簇,右侧柱状图显示每个菌株中每个簇的KZFP蛋白数量。可见C57BL/6J和CAST/EiJ在KZFP簇的拷贝数和结构上存在显著差异,T2T组装解析了这些在GRCm39中不完整的区域。
亮点 5|PAR与KZFP位点获得完整序列
PAR是性染色体末端的假常染色体区,GRCm39中仅部分组装。本研究组装了CAST/EiJ X染色体PAR(除一个大SD外),并与C57BL/6J PAR比较,发现PAR边界位置不同,存在大重复单元和拷贝数差异。在PAR中鉴定出10个基因(4个为新基因)和4个假基因。此外,T2T组装解析了chr2和chr4上的KZFP簇,在C57BL/6J中鉴定出超过48个新的推定KZFP,并发现KZFP簇的大规模结构变异。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: PacBio HiFi、Oxford Nanopore超长测序、trio-binning组装、Verkko、Hifiasm、RNA-seq、RepeatMasker、SyRI
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事小鼠基因组学、比较基因组学、结构变异或重复序列分析的研究人员。
带走一句
T2T基因组为重复区域分析提供完整参考,做结构变异或表观遗传研究时,应优先考虑使用T2T组装而非GRCm39,以避免因缺口导致的假阴性或错误定位。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。