周启涛生物技术工作室
多组学与方法2024/10/11· 编译自 Nature Biotechnology

IF46.9|DREAM挑战赛优化基因调控序列深度学习模型

百万随机启动子数据训练出的模型,跨物种预测依然领先。

百万随机启动子数据训练出的模型,跨物种预测依然领先。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

在真核生物中,转录因子(TFs)通过与DNA结合调控基因表达,是顺式调控机制的核心。尽管神经网络(NNs)在基因组学建模中展现出巨大潜力,但不同架构(如CNN、RNN、Transformer)和训练策略对模型性能的影响缺乏系统评估。此前研究往往针对特定数据集构建模型,模型间难以公平比较,且不清楚性能提升来自架构改进还是数据差异。计算机视觉和自然语言处理领域已通过标准化数据集(如ImageNet)推动模型持续进步,而基因组学领域缺少类似的黄金标准数据集和基准测试。

科学问题

卡在哪里: 基因组学模型通常为特定数据集临时构建,缺乏标准化评估,导致模型间无法直接比较,难以判断性能提升的真正原因。此外,现有模型在预测顺式调控的细微变化(如单核苷酸变异、转录因子结合位点的扰动)方面仍存在明显不足,且不同架构和训练策略的贡献未被系统拆解。

本文要回答: 通过组织随机启动子DREAM挑战赛,系统评估不同模型架构和训练策略对基因调控序列建模性能的影响,并构建一个可推广的标准化基准数据集和模块化分析框架。

技术路线

作者主要用了:DREAM挑战赛、随机启动子文库、FACS分选、RNA-seq、Prix Fixe框架

作者首先构建了包含数百万条80bp随机DNA序列及其在酵母中表达水平的训练数据集,通过FACS分选和测序获得。随后举办DREAM挑战赛,要求参赛者仅使用该数据集训练序列到表达模型,并在包含多种序列类型(如随机、天然、SNV、motif扰动等)的测试集上评估。为了公平比较,作者开发了Prix Fixe框架,将模型拆解为数据处理、训练器、第一层块、核心层块和最终层块等模块,允许不同模型的模块自由组合,从而系统分析各组件对性能的贡献。最后,将优化后的模型应用于果蝇和人类数据集,验证其跨物种和跨数据类型的泛化能力。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了DREAM挑战赛的整体流程和模型性能比较。a部分显示参赛者使用随机启动子训练数据,通过公共排行榜迭代优化模型,最终在包含八种序列类型的测试集上评估。b和c部分通过bootstrap分析展示了模型排名的稳健性。d和e部分显示顶级模型在各测试子集上的排名一致性,但Pearson和Spearman分数有时存在差异。f和g部分显示模型在天然序列上的性能差异大于随机序列,且在极端表达子集上差异最大。

核心亮点

亮点 1|顶级模型超越现有最佳水平

所有顶级模型均采用神经网络,但架构各异:第一名基于EfficientNetV2的卷积网络,第二名使用双向LSTM,第三名采用Transformer。与之前最佳模型(Vaishnav等人的Transformer)相比,顶级模型性能大幅提升,其中19个模型超过了该基准。值得注意的是,第一名模型仅含200万参数,是前十名中参数最少的,表明高效设计可大幅减少参数需求。此外,参赛团队引入了多种创新训练策略,如将回归问题转化为软分类、添加额外输入通道指示单细胞观测和反向互补序列、随机掩蔽输入序列并预测掩蔽核苷酸作为正则化等。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了Prix Fixe框架的模块化设计和组合结果。a部分说明框架将模型拆解为数据处理、训练器、第一层块、核心层块和最终层块等模块。b部分以热图形式展示了前三名模型所有兼容模块组合的性能,灰色单元格表示不兼容或未收敛的组合。c部分显示使用Autosome.org的数据处理器和训练器后,BHI和UnlockDNA模型性能显著提升。d部分显示优化后的模型在参数更少的情况下性能更优。

亮点 2|测试子集揭示模型差异

在测试集的不同子集上,模型表现差异显著。对于随机序列,模型间性能差异较小(Pearson r²差异约5%),但在天然酵母序列上差异扩大至17.6%,表明顶级模型更好地学习了进化产生的调控语法。在极端表达序列(高表达和低表达)上,模型间性能差异最大(中位差异约48%),反映了细胞分选在极端区间的信噪比降低带来的挑战。对于单核苷酸变异(SNV)预测,模型间性能差异达14.6%,说明顶级模型更能捕捉顺式调控的细微变化。这些结果强调了多维度评估基因组学模型的重要性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示了DREAM优化模型在跨物种和跨数据类型任务上的表现。a部分显示在果蝇STARR-seq数据上,DREAM-RNN和DREAM-CNN均优于DeepSTARR。b部分显示在人类MPRA数据上,DREAM模型优于MPRAnn,且差距随数据量增大而扩大。c和d部分显示在K562 ATAC-seq数据上,DREAM-RNN在读取计数和可及性预测上均优于ChromBPNet,而DREAM-CNN在读取计数上与ChromBPNet相当。

亮点 3|Prix Fixe框架优化模型配置

通过Prix Fixe框架,作者将前三名模型拆解为模块并测试了81种组合,其中45种兼容。结果显示,使用Autosome.org的数据处理器和训练器模块后,BHI和UnlockDNA模型的性能显著提升。此外,每个团队的核心架构均可进一步优化,得到性能更优且参数更少的模型。最终,基于Autosome.org、BHI和UnlockDNA的核心块分别优化得到DREAM-CNN、DREAM-RNN和DREAM-Attn模型。这些模型在归因分析中表现出相似的顺式调控逻辑视图,支持了低亲和力结合位点在顺式调控元件中重要作用的观点。

亮点 4|跨物种与跨数据类型泛化

将DREAM优化模型应用于果蝇STARR-seq数据时,DREAM-RNN和DREAM-CNN均显著优于专门设计的DeepSTARR模型,其中DREAM-RNN表现最佳。在人类MPRA数据上,DREAM模型也大幅超越MPRAnn,且性能差距随训练数据量增加而扩大。在预测K562细胞ATAC-seq开放性方面,DREAM-RNN在读取计数和染色质可及性预测上均显著优于ChromBPNet,而DREAM-CNN在读取计数上与ChromBPNet相当。值得注意的是,这些评估仅对模型进行了最小调整(如修改预测头、调整批大小和学习率),证明了模型的强大泛化能力。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: DREAM挑战赛、随机启动子文库、FACS分选、RNA-seq、Prix Fixe框架
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事基因调控建模、深度学习模型开发或基准测试的研究人员。

带走一句

标准化基准数据集和模块化分析框架能有效推动基因组学模型进步,训练策略与架构同等重要。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。