周启涛生物技术工作室
基因组与遗传2025/05/28· 编译自 Nature

IF50.5|大麻泛基因组揭示驯化大麻素合酶与野生镶嵌结构

193个基因组揭示大麻极端结构变异,驯化大麻素合酶却异常保守。

193个基因组揭示大麻极端结构变异,驯化大麻素合酶却异常保守。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

大麻(Cannabis sativa)是重要的种子油、纤维和药用植物,但近百年的法律禁令严重限制了其育种和种质资源开发。已有参考基因组CBDRx(cs10)解析了大麻素合酶基因(CBDAS、THCAS)嵌套在保守的转座子(TE)阵列中的结构,并揭示高CBD大麻(HC hemp)通过将CBDAS位点渐渗入大麻(MJ)遗传背景而获得高产CBD。然而,大麻基因组高度复杂:约79%为转座子,杂合度超过2%,且不同用途品系间存在显著结构变异。此前研究多基于短读长测序或单一参考基因组,无法全面解析大麻的泛基因组多样性、杂交历史及关键农艺性状的遗传基础。

科学问题

卡在哪里: 此前大麻基因组研究受限于短读长测序和单一参考基因组,无法解析高度重复区域和大型结构变异(SV),导致大麻的全球遗传多样性、群体结构、杂交历史以及大麻素合酶基因座的进化动态仍不清楚。此外,大麻性染色体(X/Y)的性别决定区(SDR)与拟常染色体区(PAR)边界变异、以及稀有varin型大麻素(THCV/CBDV)生物合成途径的完整遗传基础也未被阐明。

本文要回答: 构建大麻泛基因组,全面解析其遗传多样性、群体结构、性染色体进化、转座子与结构变异的作用,并揭示大麻素合酶基因的驯化机制及varin型大麻素生物合成的遗传基础。

技术路线

作者主要用了:PacBio HiFi/CLR长读长测序、Hi-C染色体构象捕获、Minigraph-Cactus/PGGB泛基因组图、PanKmer k-mer分析、OrthoFinder、SyRI结构变异检测、F2群体QTL定位、RNA-seq

作者选取144份生物样本(含雌雄),利用PacBio长读长和Hi-C技术组装了181个新基因组,结合12个已发表基因组构建大麻泛基因组,其中78个为染色体水平、单倍型解析的高质量组装。通过参考基因组(Minigraph-Cactus)和无参考(PGGB、PanKmer)两种策略构建泛基因组图,并利用k-mer聚类、系统发育和群体遗传学方法解析群体结构。同时,对F1杂交种EH23进行单倍型分型组装,结合F2群体表型数据(大麻素含量、开花时间)进行QTL定位和候选基因分析,以揭示关键农艺性状的遗传基础。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了大麻泛基因组的基本特征。a图以EH23为例,显示10对染色体的基因密度、CpG含量和结构变异(灰色为同线区,橙色为倒位),并标注了着丝粒、端粒、rDNA和大麻素合酶基因位置。b图比较了X和Y染色体,显示Y染色体更大且SDR区域基因密度低。c和d图分别基于直系同源基因和k-mer的收集曲线,表明在100-125个基因组后直系同源基因多样性趋于饱和,但k-mer多样性仍在增加。e图显示核心基因仅占23%,近核心基因占55%。f和g图通过k-mer聚类揭示五个群体,并显示野生西藏样本与所有驯化品系分离。

核心亮点

亮点 1|泛基因组揭示五个遗传群体

基于193个基因组的k-mer聚类分析,大麻可划分为五个遗传群体:欧洲纤维/籽用大麻、亚洲大麻、北美大麻(MJ)、高CBD大麻(HC hemp)以及一个野生西藏样本。其中,MJ与HC hemp群体内部又可分为与亚洲大麻或欧洲大麻亲缘更近的两个亚群,反映了历史上亚洲与欧洲大麻的杂交育种事件。值得注意的是,单个野生西藏样本与所有驯化品系显著分化,暗示亚洲偏远地区可能仍存在野生大麻近缘种。此外,核心基因(存在于所有基因组)仅占23%,而55%为近核心基因,表明大麻泛基因组具有高度可变的基因内容。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2聚焦转座子(TE)动态。a图显示不同群体基因组中TE覆盖率的密度分布,MJ群体TE含量最高。b和c图分别展示片段化和完整TE的年龄分布,显示过去10万年内(尤其近1万年)有大量TE插入。d-g图展示solo:intact LTR比率,其中Ty1-LTR在Y染色体SDR中比率最高。h图显示Y染色体上SDR区域甲基化水平高于PAR。i和j图示意TE插入后通过异位重组形成solo LTR的机制。

亮点 2|性染色体SDR-PAR边界存在变异

大麻Y染色体约110 Mb,其中SDR长达79-84 Mb,是植物中最大的SDR之一,而PAR仅约29 Mb却包含1,900-1,980个基因。通过Y特异性k-mer和X-Y直系同源基因系统发育分析,鉴定出两种SDR单倍型:Ya(6个样本)和Yb(2个样本),其SDR-PAR边界相差约51-132 kb。边界附近基因SPT5(转录延伸因子)在Ya单倍型中位于SDR内,而在Yb中位于PAR内,该基因与开花调控因子FLC互作,提示开花时间选择可能驱动了SDR的逐步扩张。此外,PAR中38%的基因在雄花中偏倚表达,而SDR中仅6%,表明雄性花发育的转录网络广泛分布于全基因组。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示结构变异(SV)的分布和特征。a图显示不同群体中倒位、重复和易位的数量,欧洲大麻、亚洲大麻和MJ群体在易位和重复数量上差异显著,但倒位数量无显著差异。b图显示易位(紫色直方图)、重复(深红色条带)和倒位(黄色条,长度按比例)在染色体上的非随机分布,热点区域与TE富集区重叠。c和d图展示1号染色体上19.5 Mb大倒位区域的连锁不平衡(LD)和局部PCA,显示该区域存在单倍型结构和LD增强,但未完全抑制重组。

亮点 3|转座子驱动基因组变异与压缩

转座子(TE)平均占大麻基因组的68%,其中LTR反转录转座子占50%。许多完整TE在过去10万年内插入,表明近期TE活动活跃,尤其在F1杂交种和MJ群体中。尽管TE持续活跃,大麻基因组(约750 Mb)却远小于其近缘属葎草属(Humulus,1,700-2,700 Mb),这归因于高solo:intact LTR比率(尤其是Ty1-LTR),表明通过异位重组清除TE。在Y染色体的SDR中,Ty1-LTR的solo:intact比率最高,暗示TE插入后通过删除事件驱动了SDR的初始扩张。此外,TE甲基化水平高于基因组平均水平,且SDR区域甲基化增强,与基因表达抑制一致。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示大麻素生物合成途径及合酶基因的基因组组织。a图显示途径中每个基因的拷贝数分布,ALT基因拷贝数变异极大(2-14个)。b和c图展示THCAS和CBDAS基因的系统发育和拷贝数,显示每个单倍体基因组最多一个全长拷贝。d图显示7号染色体上合酶基因的位置,CBCAS通常距着丝粒15-20 Mb,但可因倒位靠近THCAS。e图展示合酶盒的排列类型,与特定TE相关联。

亮点 4|结构变异揭示隐藏的多样性

大麻基因组中,结构变异(SV)高度丰富:平均每个基因组有86个倒位,倒位大小从200 bp到25 Mb不等。将SV和非比对区域纳入后,平均杂合度(可变区域)高达基因组总长的20.6%,远高于仅基于SNP的1-2.5%。倒位断点富集片段重复和反向重复,而小到中等大小的易位、重复和倒位常由TE介导。在MJ基因组中,重复断点显著富集三种DNA TE家族和Ty3-LTR-RT,而其他群体仅富集Harbinger和Mutator DNA TE。此外,1号染色体上19.5 Mb的大倒位在17个样本中以杂合状态存在(15个杂合,1个纯合),可能作为超基因维持平衡多态性。该倒位区域包含开花时间基因PRR3,其含有一个高Fst SNP(0.61),且在F1杂交种中表达偏倚,与日中性(autoflower)性状相关。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示varin型大麻素生物合成的遗传解析。a图通过PanKmer交叉分析定位7号染色体上的断点,显示UFBb有一个交叉点(5 Mb)打破HO40 THCAS与varin单倍型ALT基因的连锁,而WCFBb有两个交叉点导致HO40 ALT等位基因缺失。b图显示EH23a和EH23b中ALT3和ALT4的排列。c图展示ALT3直系同源群OG2876的蛋白邻接树,显示三个成员及可变剪接变体。e图显示BKR基因的6-外显子变体(2-bp缺失)与11/12-外显子模型的比较。f图展示BKR蛋白的系统发育,6-外显子变体与某些亚洲大麻、欧洲大麻和野生变体聚在一起。

亮点 5|大麻素合酶基因座高度保守

尽管大麻基因组整体高度可变,但大麻素合酶基因(THCAS和CBDAS)却表现出极低的多样性。每个单倍体基因组最多含有一个全长THCAS或CBDAS,它们嵌套在相似的TE盒阵列中,周围散布着假基因。这些合酶盒在基因组中仅存在少数几种排列方式,并与特定TE相关联,表明选择将少数功能性等位基因与假基因盒单倍型连锁。大多数THCAS和CBDAS基因非同线,且与品系间倒位相关,但通常局限于7号染色体约1.5 Mb的区域内。相比之下,CBCAS基因在56%的基因组中存在,拷贝数1-15个不等,但表达量极低,且在大规模样本中几乎检测不到CBCA产物,暗示其未受强烈选择。

亮点 6|varin型大麻素生物合成的遗传基础

通过F2群体QTL定位和k-mer交叉分析,作者在7号染色体起始处鉴定出酰基脂质硫酯酶基因ALT3和ALT4的复合体,与varin型大麻素(THCV/CBDV)产生相关。ALT基因拷贝数变异大(2-14个拷贝),分布在4条染色体上。此外,4号染色体上的BKR基因存在一个2-bp缺失导致6-外显子功能丧失变体,该变体仅存在于高varin亲本HO40谱系中,可能通过增加丁酰-ACP底物池促进varin合成。系统发育分析表明,varin相关基因可能起源于亚洲。这些发现完善了varin大麻素生物合成途径的遗传模型。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: PacBio HiFi/CLR长读长测序、Hi-C染色体构象捕获、Minigraph-Cactus/PGGB泛基因组图、PanKmer k-mer分析、OrthoFinder、SyRI结构变异检测、F2群体QTL定位、RNA-seq
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事植物泛基因组、结构变异、驯化遗传学或大麻研究的科研人员。

带走一句

泛基因组图+长读长组装能揭示短读长测序遗漏的大量结构变异,对于高度杂合、TE丰富的物种,这是解析关键农艺性状遗传基础的必要手段。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。