周启涛生物技术工作室
基因组与遗传2025/11/24· 编译自 Nature Methods

IF36.1|Helixer:深度学习结合HMM实现真核生物基因从头预测

无需RNA-seq等额外数据,Helixer仅凭基因组序列即可产出接近参考质量的基因模型。

无需RNA-seq等额外数据,Helixer仅凭基因组序列即可产出接近参考质量的基因模型。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

基因结构注释是基因组学分析的基础,但现有工具如GeneMark-ES、AUGUSTUS等基于隐马尔可夫模型(HMM),难以独立捕捉真核基因的复杂结构,通常需要整合RNA-seq、同源蛋白等外部证据,且计算资源消耗大。近年来,深度学习在基因预测的某些子任务中展现出潜力,但缺乏一个端到端、可广泛应用的从头预测工具。Helixer在此背景下应运而生,旨在利用深度神经网络直接从DNA序列预测基因结构,并通过HMM后处理生成完整基因模型。

科学问题

卡在哪里: 现有从头基因预测工具要么依赖外部数据,要么计算成本高,且在不同物种间性能不稳定。深度学习虽在局部预测上有所突破,但尚未形成一个完整的、可扩展的真核基因注释流程,尤其是缺乏针对植物、真菌、无脊椎动物等非哺乳动物的预训练模型。

本文要回答: 开发一个基于深度学习的从头基因预测工具Helixer,无需外部数据即可在多种真核生物中产出高质量基因模型,并评估其与现有工具的性能差异。

技术路线

作者主要用了:深度学习、CNN+bLSTM、HMM后处理、BUSCO、GffCompare、OrthoFinder

作者构建了Helixer框架,首先使用卷积神经网络(CNN)和双向长短期记忆网络(bLSTM)的混合模型对基因组序列进行碱基水平的基因类别(基因间区、UTR、CDS、内含子)和编码相位预测,然后通过一个定制的隐马尔可夫模型(HelixerPost)将预测结果转化为生物学上合理的基因模型。训练数据来自936个高质量参考基因组,并针对不同谱系(植物、脊椎动物、无脊椎动物、真菌)分别训练模型。评估时,作者在45个测试物种上与GeneMark-ES和AUGUSTUS进行基准比较,并使用BUSCO、GffCompare和OrthoFinder等指标评估预测质量。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了HelixerPost(圆形)、AUGUSTUS(三角形)和GeneMark-ES(正方形)在四个谱系(植物、脊椎动物、无脊椎动物、真菌)中的精确率和召回率比较。在植物和脊椎动物中,HelixerPost的散点普遍位于右上方,表明更高的精确率和召回率;在无脊椎动物中,HelixerPost整体略优,但部分物种被其他工具超越;在真菌中,三者性能重叠,HelixerPost仅以微小优势领先。该图直观反映了Helixer在不同进化分支上的性能差异。

核心亮点

亮点 1|Helixer在植物和脊椎动物中表现最优

在45个测试物种中,HelixerPost在植物和脊椎动物中的相位F1、亚基因F1和基因F1均显著高于GeneMark-ES和AUGUSTUS。例如,在植物中,HelixerPost的相位F1中位数比GeneMark-ES高约0.1,比AUGUSTUS高约0.05。在无脊椎动物中,Helixer整体略优,但并非所有物种都领先;在真菌中,三者性能相近,Helixer仅以微小优势领先。这些结果表明Helixer在系统发育多样性上具有竞争力,尤其在没有外部数据的情况下。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2比较了HelixerPost脊椎动物模型(五边形)、哺乳动物模型(圆形)与Tiberius(加号)及其软掩蔽版本(叉号)在哺乳动物测试物种上的外显子、基因和内含子F1分数。Tiberius在基因水平上显著优于Helixer,基因F1高出约20%;在外显子水平上,两者召回率接近,但Tiberius的精确率高出10–15%。这表明尽管Helixer在哺乳动物中不如Tiberius,但其提供了更广泛的谱系覆盖。

亮点 2|Helixer预测接近参考注释质量

通过BUSCO完整性评估,Helixer在植物和脊椎动物中的预测蛋白质组完整性接近参考注释,甚至在某些物种中超过参考。在植物测试集上,使用OrthoFinder进行同源组聚类分析显示,Helixer的预测蛋白质组形成的直系同源组数量和质量介于参考和GeneMark-ES之间,但更接近参考。Mapman4注释进一步显示,Helixer的精确度(0.878)低于参考(0.966),但召回率(0.958)高于参考(0.931),表明Helixer能找回更多真实基因,但可能包含一些假阳性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3是HelixerPost的HMM状态示意图,展示了CDS状态被细分为10个子状态(按相位和密码子类型),内含子状态被细分为60个子状态(按起始/延续、剪接基序和外部状态)。该图说明了HelixerPost如何利用生物学先验知识(如剪接位点共识序列、起始密码子ATG)来约束和优化深度学习输出的基因结构,从而生成生物学上合理的基因模型。

亮点 3|Helixer补充拟南芥参考注释的缺失基因

在拟南芥中,与Araport11参考注释比较,约70%的基因位点完全匹配。在Helixer独有的711个注释中,102个被证实为真实基因(通过20个链型植物物种的保守性验证)。一个典型例子是磷脂酰肌醇N-乙酰氨基葡萄糖转移酶γ亚基,该基因在TAIR10中完全缺失,在Araport11中与相邻基因嵌合,而Helixer正确预测了该基因,且其表达得到RNA-seq数据支持。这表明Helixer能够识别并补充高质量参考注释中的遗漏。

亮点 4|Helixer计算效率高,适合大规模基因组注释

在单线程模式下,Helixer注释263 Mbp的Oryza brachyantha基因组仅需27分钟,注释3.3 Gbp的人类基因组需约8.5小时,比GeneMark-ES和AUGUSTUS快6.2–20.1倍。尽管Tiberius在哺乳动物中速度更快(人类基因组1小时39分钟),但Helixer提供了更广泛的谱系模型。这种效率使得Helixer适用于大规模基因组项目,尤其是计算资源有限的情况。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 深度学习、CNN+bLSTM、HMM后处理、BUSCO、GffCompare、OrthoFinder
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事基因组注释、比较基因组学或需要快速获取基因模型的生信研究人员。

带走一句

对于缺乏RNA-seq或同源数据的非模式物种,Helixer提供了一种快速、可靠的从头注释方案,可作为BRAKER等流程的输入或独立使用。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。