IF36.1|长读长RNA测序系统基准:转录本水平分析更稳健
SG-NEx数据集揭示长读长RNA-seq在主要异构体鉴定上优于短读长。
SG-NEx数据集揭示长读长RNA-seq在主要异构体鉴定上优于短读长。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
基因表达通常以基因总RNA量衡量,但可变启动子、外显子跳跃、内含子保留等使单基因产生多种异构体,其表达可独立调控,与发育、细胞身份和疾病相关。短读长RNA-seq成本低、通量高,但PCR扩增和片段化引入偏差,且读长限制导致无法唯一分配读段到转录本,复杂转录事件难以捕获。长读长测序(Nanopore和PacBio)可跨越全长转录本,有望克服这些局限,但现有数据集存在通量低、缺乏重复、覆盖单一方案等问题,缺乏系统比较。
科学问题
卡在哪里: 此前长读长RNA-seq研究受限于低通量、无重复、单一细胞系或单一方案,缺乏多平台、多重复、含spike-in对照的系统基准数据,无法全面评估不同方案在转录本水平定量上的准确性和偏差。
本文要回答: 系统比较五种RNA-seq方案(短读长、Nanopore直接RNA、直接cDNA、PCR cDNA、PacBio IsoSeq)在基因和转录本表达定量上的表现,并评估片段化对转录本定量的影响。
技术路线
作者主要用了:Nanopore直接RNA、直接cDNA、PCR cDNA、PacBio IsoSeq、Illumina短读长、spike-in对照、m6ACE-seq。
作者建立SG-NEx数据集,对7个人类细胞系(HCT116、HepG2、A549、MCF7、K562、HEYA8、H9)分别用五种RNA-seq方案进行多重复测序,并加入已知浓度的spike-in RNA(Sequin、ERCC、SIRV)作为定量基准。同时开发nf-core/nanoseq流程统一处理数据。通过比较各方案的读长、覆盖度、基因和转录本表达估计,并利用spike-in评估准确性,进一步通过in silico片段化模拟短读长,结合qPCR/dPCR实验验证主要异构体鉴定差异。

图 1 Fig. 1。图1展示SG-NEx核心数据集设计:7个人类细胞系(HCT116、HepG2、A549、MCF7、K562、HEYA8、H9)分别用5种RNA-seq方案测序,每个细胞系至少3个重复。b和c显示各细胞系和方案的测序运行数,d展示nf-core/nanoseq流程,包括质量控制、比对、转录本发现和定量等模块。
核心亮点
亮点 1|长读长方案在spike-in定量上更准确
使用spike-in RNA(ERCC、SIRV、Sequin)评估基因表达定量准确性,Nanopore长读长方案(直接cDNA和PCR cDNA)的估计值与预期浓度相关性最高,误差最低。PacBio IsoSeq因对短转录本覆盖不足导致偏差最大。在转录本水平,Nanopore长读长对Sequin RNA的估计相关性也高于短读长。这些结果表明长读长在已知浓度RNA的定量上具有优势。

图 2 Fig. 2。图2比较五种方案的测序通量、读长、覆盖度和转录本多样性。a显示PCR cDNA通量最高,接近短读长;b显示PacBio IsoSeq平均读长最长,其次为直接RNA;c显示长读长方案在转录本5'和3'端覆盖更均匀,直接RNA在3'端覆盖更高;d显示PCR cDNA和PacBio IsoSeq的full-splice-match reads比例最高;e显示PCR cDNA中高表达基因占比更高;f显示某些基因在PCR cDNA中覆盖不全。
亮点 2|主要异构体鉴定:长读长更稳健
在人类细胞系中,长读长和短读长RNA-seq对每个基因鉴定出的主要异构体(表达量最高的转录本)存在大量不一致:平均每个细胞系有7,389个基因的主要异构体不同。对于长读长特异的主要异构体,其表达估计在两种技术间相关性显著高于短读长特异的主要异构体(Mann-Whitney U检验P<0.0001)。短读长特异的主要异构体常使用长读长特异主要异构体的内部外显子作为首/末外显子,且表达量常被高估。

图 3 Fig. 3。图3评估基因表达定量准确性。a显示spike-in RNA的log2 CPM估计值与预期值的散点图,Nanopore长读长方案相关性最高;b-e显示不同方案间基因表达估计的相关性,蛋白编码基因相关性最高;f显示基于基因表达的样本聚类,同一细胞系的不同方案聚在一起。
亮点 3|片段化导致短读长主要异构体高估
通过将长读长数据in silico片段化为150bp模拟短读长,发现短读长特异的主要异构体在片段化后表达估计显著升高,而长读长特异的主要异构体受影响较小。片段化后模拟数据与真实短读长数据的相关性从0.38提高到0.61(P<0.0001),表明片段化是造成短读长和长读长转录本定量差异的部分原因。

图 4 Fig. 4。图4比较转录本表达估计。a显示spike-in转录本估计与预期值的散点图,长读长方案相关性更高;b-c显示主要异构体、长读长特异和短读长特异主要异构体在不同方案间的相关性,长读长特异主要异构体相关性更高;d显示短读长特异主要异构体更常使用内部外显子作为首/末外显子;e显示短读长特异主要异构体在长读长数据中表达量常低于1 CPM;f-g显示长读长覆盖更多剪接点和更多唯一分配读段。
亮点 4|实验验证支持长读长鉴定结果
对MCF7细胞系中13个主要异构体不一致的基因进行dPCR和qPCR验证,dPCR浓度与长读长RNA-seq估计高度相关(Pearson r=0.97),而与短读长RNA-seq估计负相关(r=-0.6)。所有13个基因的长读长特异主要异构体均为实际最丰富异构体,证实长读长数据更准确地鉴定主要异构体。

图 5 Fig. 5。图5展示片段化模拟和实验验证。a为片段化模拟示意图;b-d显示片段化对主要异构体表达估计的影响,短读长特异主要异构体受影响最大;e-f显示dPCR浓度与长读长RNA-seq估计高度相关(r=0.97),与短读长负相关(r=-0.6);g-n显示13个基因的验证结果,长读长特异主要异构体均为实际最丰富异构体。
亮点 5|SG-NEx数据集揭示复杂转录事件
利用全长读段,作者在7个细胞系中鉴定出数千个由full-splice-match reads支持的可变异构体,最常见事件为外显子跳跃(40.4%)、可变启动子(21%)和可变末端外显子(16.8%)。还发现1,531个新转录本(40.6%来自未注释基因座),其外显子显著富集重复元件(P<0.001)。在6个癌细胞系中鉴定出106个融合基因,其中74.5%已有验证或短读长证据。此外,利用直接RNA-seq数据预测了6,337个m6A位点,59%在HCT116中得到m6ACE-seq验证。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: Nanopore直接RNA、直接cDNA、PCR cDNA、PacBio IsoSeq、Illumina短读长、spike-in对照、m6ACE-seq
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/GoekeLab/sg-nex-data
- 谁该点开原文: 从事转录组分析、方法开发或基准测试的生物信息学研究人员和研究生。
带走一句
做转录本水平定量时,长读长RNA-seq能更稳健地鉴定主要异构体,短读长可能因片段化高估某些异构体;建议结合长读长数据验证关键异构体。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。