IF31.7|大麦泛转录组揭示基因型依赖的转录复杂性
20个基因型、5种组织的泛转录组,揭示核心基因表达变异由RNA加工、拷贝数和启动子基序共同驱动。
20个基因型、5种组织的泛转录组,揭示核心基因表达变异由RNA加工、拷贝数和启动子基序共同驱动。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
大麦是全球重要的谷物作物,其二倍体自交特性使其成为麦类研究的模式物种。近年来,基于20个代表性基因型的染色体水平组装构建了大麦泛基因组,揭示了广泛的遗传变异,包括结构变异和拷贝数变异。然而,这些基因组多样性的功能后果尚未被系统评估。转录组是连接基因型与表型的关键层次,但传统基于单一参考基因组的转录组分析存在参考偏差,无法全面捕捉个体间的转录变异。因此,亟需构建涵盖多个基因型的泛转录组资源,以解析基因表达调控的基因型特异性机制。
科学问题
卡在哪里: 已有的大麦泛基因组研究主要关注基因组序列变异,缺乏对转录组层面的系统比较。单一参考基因组导致RNA-seq定量偏差,且现有转录组数据多来自单一基因型或有限组织,无法全面揭示基因型间的表达差异及其调控基础。
本文要回答: 构建大麦泛转录组,系统解析20个基因型间转录组变异的层次和驱动因素,并评估其对基因表达调控和表型的影响。
技术路线
作者主要用了:RNA-seq、PacBio Iso-seq、基因型特异参考转录组(GsRTD)、泛参考转录组(PanBaRT20)、WGCNA。
作者选取代表大麦全球多样性的20个自交系,对5种组织(胚、幼苗根、幼苗茎、花序、颖果)进行短读长RNA-seq和长读长Iso-seq测序。为避免单一参考偏差,为每个基因型构建基因型特异参考转录组(GsRTD),再整合到线性泛基因组框架上构建泛参考转录组(PanBaRT20)。基于此,对基因进行核心、壳层、云层分类,并分析转录本丰度变异与RNA加工、拷贝数变异、启动子基序等的关系。最后,利用WGCNA比较共表达网络,并通过公共数据构建Morex基因表达图谱,验证候选基因功能。

图 1 Fig. 1。图1展示了实验设计和泛转录组基本特征。a显示5种取样组织;b的MDS图表明组织是转录组变异的主要驱动因素;c显示PanBaRT20中核心、壳层和云层基因的比例,核心单拷贝基因占17.19%;d比较不同参考转录组的RNA-seq比对率,PanBaRT20平均87.3%,高于BaRTv2.0的76.2%,但仅比GsRTD高3.3%。
核心亮点
亮点 1|泛转录组揭示核心基因表达变异
PanBaRT20包含79,600个基因和582,000个转录本,平均每个基因7.3个转录本,远高于单个GsRTD的平均3.22个。核心单拷贝基因(13,700个)在所有基因型中均有表达,但转录本丰度在组织和基因型间存在显著差异。例如,chr2H11235和chr3H26163基因的5'剪接位点突变分别导致7个和11个基因型中剪接位点丢失,产生不同的转录本异构体。这些变异可能影响蛋白质功能,体现了RNA加工对表达多样性的贡献。

图 2 Fig. 2。图2揭示了转录丰度变异的驱动因素。a展示两个基因的5'剪接位点突变导致可变剪接;b的热图显示2,925个基因在部分基因型中零表达,形成PAV模式;c显示98个串联重复基因簇的拷贝数与表达正相关;d展示7H染色体141Mb倒位区域内的差异表达基因,上调基因靠近端粒,下调基因靠近着丝粒;e显示TFBS保守性与表达一致性的相关性在低CV基因中更强;f显示低CV基因富集核心基因,高CV基因富集壳层和云层基因。
亮点 2|拷贝数变异与转录丰度正相关
在20个基因型中,2,925个基因在至少一个基因型中完全不表达,其中2,899个基因在基因组中缺失,属于存在/缺失变异(PAV)。通过聚类分析发现723个串联重复基因簇,其中98个簇的拷贝数与转录丰度显著正相关(r>0.45, P<0.05)。例如,位于5H染色体17kb片段上的CBF2a和CBF4b基因拷贝数在1-5之间变化,高拷贝数基因型的基础表达水平更高,可能增强低温耐受性。

图 3 Fig. 3。图3呈现共表达网络分析结果。a展示WGCNA模块聚类为6个主要群落;b显示直系同源组在群落间的分布,多数被分割到多个群落;c显示各群落与组织的关联及功能富集;d举例展示Mkkk62/70、CesA9/4等基因在不同基因型中的群落归属差异。
亮点 3|启动子基序保守性解释表达一致性
通过比较20个基因型中直系同源基因上游2kb区域的30个转录因子结合位点(TFBS),发现TFBS保守性与表达一致性(TPM在Morex±30%范围内的比例)的Pearson相关系数为0.395。但将基因按表达变异系数(CV)分组后,低CV组(0-0.4)的相关系数高达0.635,而高CV组(1.48-20)仅为0.087。低CV基因富集管家功能,高CV基因富集防御和应激反应,提示高变异基因可能受远端调控元件影响更大。

图 4 Fig. 4。图4介绍Morex基因表达图谱。a展示用于构建Mx-RTD的样本类型;b的MDS图显示组织是主要变异来源;c显示五个共有组织的MDS图;d展示20个共表达模块的组织和条件特异性。
亮点 4|核心基因共表达网络的功能分化
对13,652个核心单拷贝基因进行WGCNA分析,构建20个基因型特异的共表达网络,得到738个模块。基于共享直系同源基因的余弦相似度,模块聚类为6个主要群落(C1-C6),其中C4、C5、C6分别与光合作用(茎)、淀粉代谢(颖果)和养分吸收(根)强相关。12,190个直系同源组被分割到两个或更多群落,表明核心基因在基因型间存在广泛的功能分化。例如,Mkkk62和Mkkk70在ZDM02064中与群落4关联,而在其他基因型中与群落6关联。

图 5 Fig. 5。图5展示GA2ox基因突变体的表型。a-c显示ga2ox7突变体产量、千粒重和淀粉含量降低;d-e显示其α-淀粉酶和游离极限糊精酶活性下降;f显示ga2ox3突变体在涝渍年份产量下降;g-i显示ga2ox3突变体水解酶活性升高;j-k为田间照片。
亮点 5|Morex基因表达图谱扩展组织覆盖
整合公共数据库中315个Morex RNA-seq样本,构建了Mx-RTD,包含5,230个PanBaRT20中不存在的基因。Mx-RTD与PanBaRT20在五个共有组织中的差异表达基因重叠率为93.2%,但在重金属处理、花粉和柱头等非共有条件下重叠率降至54.8%-74.7%。这表明PanBaRT20擅长基因型间比较,而Mx-RTD更适合广泛的组织和条件分析。该图谱作为MorexGeneAtlas在线资源发布,便于研究者查询基因表达模式。
亮点 6|GA2ox基因家族功能验证
以赤霉素2-氧化酶(GA2ox)基因家族为例,PanBaRT20和MorexGeneAtlas显示GA2ox7主要在颖果中高表达,而GA2ox3在多种组织和胁迫条件下表达。通过FIND-IT技术获得RGT Planet背景的ga2ox7和ga2ox3敲除突变体,田间试验表明ga2ox7突变体产量、千粒重和淀粉含量降低,麦芽品质下降;ga2ox3突变体在正常年份产量无差异,但在涝渍年份农艺性状显著下降。这验证了泛转录组数据在基因功能解析中的实用性。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: RNA-seq、PacBio Iso-seq、基因型特异参考转录组(GsRTD)、泛参考转录组(PanBaRT20)、WGCNA
- 公开数据: PRJNA382490、PRJNA910827、PRJNA975859、PRJEB64639、PRJEB49069、PRJEB29972
- 代码: 公开仓库 https://github.com/PacificBiosciences/IsoSeq、https://github.com/WCGA-Murdoch/Barley-phenology-2023、https://github.com/anonconda/RTDmaker;本地已克隆:IsoSeq、barleyPantranscriptome、Barley-phenology-2023、AHRD、PanBarleyNetworks
- 谁该点开原文: 从事植物泛基因组、转录组分析或作物遗传改良的研究人员。
带走一句
构建基因型特异参考转录组是消除参考偏差的关键,泛转录组与基因表达图谱结合能更全面地解析基因功能。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。