周启涛生物技术工作室
基因组与遗传2025/02/03· 编译自 Nature Genetics

IF31.7|大麦泛转录组揭示基因型依赖的转录复杂性

20个基因型、5种组织的泛转录组,揭示核心基因表达变异由RNA加工、拷贝数和启动子基序共同驱动。

20个基因型、5种组织的泛转录组,揭示核心基因表达变异由RNA加工、拷贝数和启动子基序共同驱动。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

大麦是全球重要的谷物作物,其二倍体自交特性使其成为麦类研究的模式物种。近年来,基于20个代表性基因型的染色体水平组装构建了大麦泛基因组,揭示了广泛的遗传变异,包括结构变异和拷贝数变异。然而,这些基因组多样性的功能后果尚未被系统评估。转录组是连接基因型与表型的关键层次,但传统基于单一参考基因组的转录组分析存在参考偏差,无法全面捕捉个体间的转录变异。因此,亟需构建涵盖多个基因型的泛转录组资源,以解析基因表达调控的基因型特异性机制。

科学问题

卡在哪里: 已有的大麦泛基因组研究主要关注基因组序列变异,缺乏对转录组层面的系统比较。单一参考基因组导致RNA-seq定量偏差,且现有转录组数据多来自单一基因型或有限组织,无法全面揭示基因型间的表达差异及其调控基础。

本文要回答: 构建大麦泛转录组,系统解析20个基因型间转录组变异的层次和驱动因素,并评估其对基因表达调控和表型的影响。

技术路线

作者主要用了:RNA-seq、PacBio Iso-seq、基因型特异参考转录组(GsRTD)、泛参考转录组(PanBaRT20)、WGCNA

作者选取代表大麦全球多样性的20个自交系,对5种组织(胚、幼苗根、幼苗茎、花序、颖果)进行短读长RNA-seq和长读长Iso-seq测序。为避免单一参考偏差,为每个基因型构建基因型特异参考转录组(GsRTD),再整合到线性泛基因组框架上构建泛参考转录组(PanBaRT20)。基于此,对基因进行核心、壳层、云层分类,并分析转录本丰度变异与RNA加工、拷贝数变异、启动子基序等的关系。最后,利用WGCNA比较共表达网络,并通过公共数据构建Morex基因表达图谱,验证候选基因功能。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了实验设计和泛转录组基本特征。a显示5种取样组织;b的MDS图表明组织是转录组变异的主要驱动因素;c显示PanBaRT20中核心、壳层和云层基因的比例,核心单拷贝基因占17.19%;d比较不同参考转录组的RNA-seq比对率,PanBaRT20平均87.3%,高于BaRTv2.0的76.2%,但仅比GsRTD高3.3%。

核心亮点

亮点 1|泛转录组揭示核心基因表达变异

PanBaRT20包含79,600个基因和582,000个转录本,平均每个基因7.3个转录本,远高于单个GsRTD的平均3.22个。核心单拷贝基因(13,700个)在所有基因型中均有表达,但转录本丰度在组织和基因型间存在显著差异。例如,chr2H11235和chr3H26163基因的5'剪接位点突变分别导致7个和11个基因型中剪接位点丢失,产生不同的转录本异构体。这些变异可能影响蛋白质功能,体现了RNA加工对表达多样性的贡献。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2揭示了转录丰度变异的驱动因素。a展示两个基因的5'剪接位点突变导致可变剪接;b的热图显示2,925个基因在部分基因型中零表达,形成PAV模式;c显示98个串联重复基因簇的拷贝数与表达正相关;d展示7H染色体141Mb倒位区域内的差异表达基因,上调基因靠近端粒,下调基因靠近着丝粒;e显示TFBS保守性与表达一致性的相关性在低CV基因中更强;f显示低CV基因富集核心基因,高CV基因富集壳层和云层基因。

亮点 2|拷贝数变异与转录丰度正相关

在20个基因型中,2,925个基因在至少一个基因型中完全不表达,其中2,899个基因在基因组中缺失,属于存在/缺失变异(PAV)。通过聚类分析发现723个串联重复基因簇,其中98个簇的拷贝数与转录丰度显著正相关(r>0.45, P<0.05)。例如,位于5H染色体17kb片段上的CBF2a和CBF4b基因拷贝数在1-5之间变化,高拷贝数基因型的基础表达水平更高,可能增强低温耐受性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3呈现共表达网络分析结果。a展示WGCNA模块聚类为6个主要群落;b显示直系同源组在群落间的分布,多数被分割到多个群落;c显示各群落与组织的关联及功能富集;d举例展示Mkkk62/70、CesA9/4等基因在不同基因型中的群落归属差异。

亮点 3|启动子基序保守性解释表达一致性

通过比较20个基因型中直系同源基因上游2kb区域的30个转录因子结合位点(TFBS),发现TFBS保守性与表达一致性(TPM在Morex±30%范围内的比例)的Pearson相关系数为0.395。但将基因按表达变异系数(CV)分组后,低CV组(0-0.4)的相关系数高达0.635,而高CV组(1.48-20)仅为0.087。低CV基因富集管家功能,高CV基因富集防御和应激反应,提示高变异基因可能受远端调控元件影响更大。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4介绍Morex基因表达图谱。a展示用于构建Mx-RTD的样本类型;b的MDS图显示组织是主要变异来源;c显示五个共有组织的MDS图;d展示20个共表达模块的组织和条件特异性。

亮点 4|核心基因共表达网络的功能分化

对13,652个核心单拷贝基因进行WGCNA分析,构建20个基因型特异的共表达网络,得到738个模块。基于共享直系同源基因的余弦相似度,模块聚类为6个主要群落(C1-C6),其中C4、C5、C6分别与光合作用(茎)、淀粉代谢(颖果)和养分吸收(根)强相关。12,190个直系同源组被分割到两个或更多群落,表明核心基因在基因型间存在广泛的功能分化。例如,Mkkk62和Mkkk70在ZDM02064中与群落4关联,而在其他基因型中与群落6关联。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示GA2ox基因突变体的表型。a-c显示ga2ox7突变体产量、千粒重和淀粉含量降低;d-e显示其α-淀粉酶和游离极限糊精酶活性下降;f显示ga2ox3突变体在涝渍年份产量下降;g-i显示ga2ox3突变体水解酶活性升高;j-k为田间照片。

亮点 5|Morex基因表达图谱扩展组织覆盖

整合公共数据库中315个Morex RNA-seq样本,构建了Mx-RTD,包含5,230个PanBaRT20中不存在的基因。Mx-RTD与PanBaRT20在五个共有组织中的差异表达基因重叠率为93.2%,但在重金属处理、花粉和柱头等非共有条件下重叠率降至54.8%-74.7%。这表明PanBaRT20擅长基因型间比较,而Mx-RTD更适合广泛的组织和条件分析。该图谱作为MorexGeneAtlas在线资源发布,便于研究者查询基因表达模式。

亮点 6|GA2ox基因家族功能验证

以赤霉素2-氧化酶(GA2ox)基因家族为例,PanBaRT20和MorexGeneAtlas显示GA2ox7主要在颖果中高表达,而GA2ox3在多种组织和胁迫条件下表达。通过FIND-IT技术获得RGT Planet背景的ga2ox7和ga2ox3敲除突变体,田间试验表明ga2ox7突变体产量、千粒重和淀粉含量降低,麦芽品质下降;ga2ox3突变体在正常年份产量无差异,但在涝渍年份农艺性状显著下降。这验证了泛转录组数据在基因功能解析中的实用性。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

构建基因型特异参考转录组是消除参考偏差的关键,泛转录组与基因表达图谱结合能更全面地解析基因功能。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。