IF36.1|Uncalled4:快速精准的纳米孔信号比对提升DNA与RNA修饰检测
更快的信号比对、更小的文件、更灵敏的m6A检测,Uncalled4让纳米孔表观修饰分析更高效。
更快的信号比对、更小的文件、更灵敏的m6A检测,Uncalled4让纳米孔表观修饰分析更高效。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
纳米孔测序通过测量DNA或RNA分子通过纳米孔时的电流变化来识别碱基,同时也能检测核苷酸修饰,无需额外文库制备。目前只有少数修饰(如5mC)能被直接basecall,大多数修饰需要先将原始信号比对到参考序列。信号比对是修饰检测的关键步骤,但现有工具(Nanopolish、Tombo)速度慢、不支持最新化学(r10.4.1、RNA004)和POD5格式,且缺乏统一格式和评估标准。此外,RNA修饰(如m6A)检测需要高分辨率的信号比对,而现有方法在低覆盖区域或复杂序列中灵敏度不足。
科学问题
卡在哪里: 现有信号比对工具Nanopolish和Tombo存在速度慢、格式不统一、不支持最新ONT化学和POD5信号格式等问题;且缺乏客观的比对质量评估方法。此外,由于比对误差和过度过滤,RNA m6A检测在低覆盖区域和特定基因中灵敏度受限。
本文要回答: 开发一个快速、准确、支持最新ONT化学的信号比对工具Uncalled4,并验证其在DNA 5mC和RNA m6A修饰检测中的性能提升。
技术路线
作者主要用了:bcDTW信号比对、BAM信号比对格式、pore model训练、KS统计、m6Anet。
作者开发了Uncalled4,采用basecaller引导的动态时间规整(bcDTW)算法,利用basecaller的moves信息缩小比对带宽,实现快速准确的信号比对。同时设计了紧凑的BAM格式存储信号比对统计量,便于下游分析。利用Uncalled4训练了r10.4.1 DNA pore model,并应用于5mCpG检测。在RNA修饰检测中,将Uncalled4比对结果输入KS统计、xPore和m6Anet,与Nanopolish和Tombo进行系统比较。最后在七个人类细胞系中应用Uncalled4+m6Anet检测m6A,并与m6A-Atlas数据库比对评估准确性。

图 1 Fig. 1。图1展示了ONT不同化学(r9.4.1、r10.4.1、RNA001/002/004)的k-mer电流分布和碱基组成,以及Uncalled4的比对可视化。r10.4.1双读头导致k-mer更长,嘌呤在低电流富集,嘧啶在高电流富集。Uncalled4的bcDTW比对(紫色线)与basecaller moves(橙色点)高度一致,且能处理剪接比对。
核心亮点
亮点 1|Uncalled4比对速度与文件大小优势显著
Uncalled4比对速度比Nanopolish快1.7-1.9倍,比Tombo快2.9-6.8倍,比f5c(GPU)快1.3-2.7倍。其BAM格式比Nanopolish eventalign小20倍以上,比gzip压缩的eventalign小6倍。Uncalled4支持FAST5、SLOW5和POD5输入,填补了Nanopolish和Tombo不支持POD5的空白。比对质量方面,Uncalled4的模型MAD最低或接近最低,且与basecaller ref-moves的平均距离在1个核苷酸以内,优于其他工具。

图 2 Fig. 2。图2分析了pore model的碱基替换效应和同聚物特征。r10.4.1在k-mer起始位置有次级读头效应。r10.4.1同聚物缺失率低于r9.4.1,但胞嘧啶同聚物缺失率最高。dwell time变异大,且受上游序列影响,主要受11-13碱基上游影响。
亮点 2|揭示r10.4.1双读头对同聚物的影响
通过分析Uncalled4比对结果,发现r10.4.1双读头设计降低了≥9nt同聚物中的缺失率,但缺失率仍受碱基类型影响,胞嘧啶同聚物缺失率最高(26%)。同聚物长度可通过dwell time估计,但dwell time变异大(标准差大于中位数),且受序列位置影响,主要受上游11-13碱基影响,可能与马达蛋白相互作用有关。这些发现有助于理解纳米孔测序错误来源。

图 3 Fig. 3。图3展示了5mCpG对r10.4.1电流的影响。5mC修饰在CpG中心位置引起最大电流变化,而次级读头位置几乎无影响。KS统计和z-score在CpG位点周围呈现双峰,对应双读头。BrdU模型训练显示Uncalled4模型能更好地区分BrdU修饰和未修饰reads。
亮点 3|发现ONT官方r10.4.1 DNA模型存在潜在错误
Uncalled4的pore model训练方法无需先验模型,通过迭代比对和平均信号特征生成模型。利用该方法训练的r10.4.1 DNA模型与ONT官方模型高度相关,但发现一组具有NNNNTVTTN基序的k-mer存在系统偏差,可能源于ONT模型错误。替换为Uncalled4模型后,5mCpG检测性能提升,表明准确模型对修饰检测至关重要。

图 4 Fig. 4。图4比较了不同信号比对工具在RNA m6A检测中的性能。Uncalled4在KS统计、xPore和m6Anet中均获得更高的AUPRC和AUROC。m6Anet使用Uncalled4比对时,在低覆盖区域发现更多m6A位点,且在不同位点集合(交集、并集、覆盖≥20×)下均优于Nanopolish。
亮点 4|Uncalled4在RNA m6A检测中全面优于Nanopolish和Tombo
在HEK293T野生型与METTL3敲除样本比较中,Uncalled4的KS统计、xPore和m6Anet的AUPRC和AUROC均高于Nanopolish和Tombo。使用m6Anet时,Uncalled4比Nanopolish多输出17%的候选位点,且在低覆盖区域优势更明显。在七个细胞系中,Uncalled4+m6Anet平均多发现18-28%的m6A位点(在85%精度下),尤其在癌症相关基因如ABL1、JUN、c-MYC中检测到更多修饰。

图 5 Fig. 5。图5展示了七个细胞系中m6A检测结果。Uncalled4在85%精度下比Nanopolish多发现28%的m6A位点。Uncalled4在低覆盖区域优势明显。大多数Uncalled4独有位点存在于m6A-Atlas中。在癌症相关基因(如ABL1、JUN)中检测到更多m6A,且发现BCR-ABL1融合转录本上的m6A。
亮点 5|Uncalled4揭示m6A-Atlas基因注释错误
在比较Uncalled4和Nanopolish检测的m6A位点时,发现TTC4基因的m6A位点均不在m6A-Atlas中,但进一步分析显示m6A-Atlas将TTC4的标签错误分配给了MROH7-TTC4通读转录本。Uncalled4的长读长比对能够区分这两个基因,表明长读长测序在表观转录组注释中的优势。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: bcDTW信号比对、BAM信号比对格式、pore model训练、KS统计、m6Anet
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事纳米孔测序数据分析、表观遗传学或RNA修饰研究的生物信息学人员。
带走一句
信号比对是纳米孔修饰检测的瓶颈,Uncalled4通过bcDTW和紧凑BAM格式大幅提升速度和灵敏度,建议分析RNA m6A时优先使用Uncalled4+m6Anet。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。