周启涛生物技术工作室
基因组与遗传2025/08/19· 编译自 Nature Genetics

IF31.7|27个拟南芥基因组揭示参考基因组偏倚

短读长比对参考基因组会系统性漏掉25–45%的SNP,并扭曲表达与甲基化分析。

短读长比对参考基因组会系统性漏掉25–45%的SNP,并扭曲表达与甲基化分析。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

过去二十五年,遗传多态性数据爆炸式增长,但主流技术依赖将短读长比对到单一参考基因组来检测变异,导致对基因组变异的认识不完整且偏向简单变异。近年来,长读长测序使高质量染色体水平基因组组装成为可能,多个物种的泛基因组研究揭示了大量结构变异。然而,如何无偏地解析全基因组多态性仍是一个巨大挑战,因为序列比对本身存在歧义,且缺乏反映突变机制和重组历史的建模框架。拟南芥作为模式植物,拥有丰富的自然种质资源和多组学数据,是研究这一问题的理想系统。

科学问题

卡在哪里: 现有短读长数据受参考基因组偏倚影响,SNP检出不全,结构变异被大量遗漏,且转录组和甲基化组分析因比对到参考基因组而产生偏差。此外,对转座子活性和移动组(mobile-ome)的认识高度依赖不完整的TE注释,无法区分活跃与非活跃元件。

本文要回答: 通过比较27个覆盖全球遗传多样性的拟南芥基因组,无偏地刻画染色体臂上的多态性,并量化参考基因组偏倚对SNP、表达和甲基化分析的影响。

技术路线

作者主要用了:PacBio CLR长读长组装、Pannagram全基因组比对、PGGB泛基因组图、RNA-seq、BS-seq

作者选取27个覆盖全球多样性的拟南芥自然品系,利用PacBio CLR长读长进行基因组组装,并用光学图谱辅助scaffolding。随后采用两种互补的全基因组比对方法——Pannagram和PGGB——来检测结构变异,其中Pannagram输出易于解释的sSV和泛基因组坐标。在此基础上,结合RNA-seq和BS-seq数据,比较将读长比对到参考基因组与比对到自身基因组对表达和甲基化估计的影响,从而量化参考偏倚。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了27个拟南芥品系的地理来源和基因组大小变异。a图地图显示品系覆盖全球主要多样性区域,颜色代表不同的混合群体。b图直方图显示基于k-mer估计的基因组大小在135–155 Mb之间,而组装大小约120 Mb,差异主要来自着丝粒和rDNA重复序列。

核心亮点

亮点 1|基因组大小变异主要由串联重复驱动

27个组装基因组大小约120 Mb,但基于k-mer估计的全基因组大小为135–155 Mb,差异几乎完全来自着丝粒和rDNA重复序列的变异。尽管不同TE家族大小在品系间差异很大,但TE对基因组大小变异的累积贡献很小,这与种间变异中TE的主导作用形成鲜明对比。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2通过全基因组比对展示染色体臂的结构保守性。a图显示染色体臂高度共线,着丝粒区域未组装(黄色),倒位以粉色标示。b图显示泛基因组图气泡密度在近着丝粒区域和约20 Mb处升高,后者对应祖先着丝粒丢失区域。

亮点 2|结构变异数量远超SNP,且与TE紧密相关

在染色体臂上共鉴定出532,178个简单结构变异(sSV),影响超过37.5 Mb序列。两个品系间平均存在约190,000个长度小于10 kb的SV,覆盖约12.5 Mb,相当于每个组装基因组的10%。超过60%的sSV与已注释TE序列有重叠,其中低频插入往往对应完整TE,而低频缺失对应不完整TE片段,表明近期TE活动是结构变异的主要来源。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示sSV的长度和频率分布。a图显示不同长度sSV的存在等位基因频率分布,长插入往往低频,短缺失往往高频。b图显示各频率区间中不同长度类别的比例,进一步支持sSV主要由长插入和短缺失构成。

亮点 3|移动组揭示大量未注释的活跃转座子

通过基于序列相似性的嵌套图聚类,作者构建了移动组(mobile-ome),发现许多sSV虽未被注释为完整TE,但实际上是活跃转座子的一部分。在无TE注释的sSV中,有238个连通分量包含至少3个节点,其中97个编码TE蛋白,部分显示水平基因转移证据。此外还发现了一些缺乏蛋白编码能力但高频存在的潜在新移动元件家族。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示sSV与TE注释的重叠关系。a图将sSV分为不同TE内容类别,b图显示超过60%的sSV与TE有重叠。c和d图显示低频sSV更可能对应完整TE,而高频sSV更可能对应TE片段。e图显示完整TE相关sSV在约5 kb处富集。

亮点 4|基因组高度保守,但存在大量新基因

独立注释每个基因组后,共获得34,153个基因,其中2,661个蛋白编码基因和565个TE基因是此前未注释的。87%的基因在所有27个品系中均存在,表明基因含量高度保守。与拟南芥近缘种A. lyrata比较发现,大多数TAIR10基因是祖先基因,而新注释基因大多不是祖先基因;分离基因(segregating genes)表达水平显著低于固定基因,且受到更强的表观遗传沉默。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示移动组的嵌套图。a图显示几乎所有对应完整TE的sSV都包含在图中。b图显示按TE内容着色的嵌套图,存在一个大的主导连通分量。c图显示按TE超家族着色,主导分量包含所有已知超家族成员,表明TE插入到已有TE中或注释错误。

亮点 5|短读长分析存在严重参考偏倚

将短读长比对到参考基因组进行SNP calling会漏掉25–45%的SNP,主要原因是读长无法可靠比对到存在结构变异的区域。即使使用高覆盖度PCR-free数据,降低缺失率也会导致假发现率接近7%。此外,将RNA-seq和BS-seq读长比对到参考基因组而非自身基因组,会导致部分基因表达估计严重偏差,并产生大量虚假的差异甲基化区域。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: PacBio CLR长读长组装、Pannagram全基因组比对、PGGB泛基因组图、RNA-seq、BS-seq
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事植物基因组学、群体遗传学或表观遗传学研究的科研人员,尤其是关注结构变异和参考偏倚的学者。

带走一句

做基因组或表观组分析时,别只依赖单一参考基因组;用多个高质量基因组比对能显著减少偏倚,并发现被遗漏的变异和调控元件。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。