周启涛生物技术工作室
基因组与遗传2026/01/28· 编译自 Nature

IF50.5|AlphaGenome:1 Mb序列统一预测多模态调控变异效应

一个模型同时预测表达、剪接、染色质等多模态,变异效应预测在25/26项基准中达最优。

一个模型同时预测表达、剪接、染色质等多模态,变异效应预测在25/26项基准中达最优。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

非编码变异占人类遗传变异的98%以上,但其分子后果多样,包括改变染色质可及性、表观修饰、三维构象、mRNA表达与剪接等,且具有细胞类型特异性。序列到功能深度学习模型通过学习DNA序列与功能基因组实验数据的映射,能够预测基因组轨道并推断变异效应。然而,现有模型面临两个核心权衡:一是输入序列长度与预测分辨率之间的权衡,长序列模型(如Enformer、Borzoi)分辨率低,短序列模型(如SpliceAI、BPNet)无法捕获远端调控;二是多模态覆盖与单模态专精之间的权衡,通用模型在特定任务上常落后于专用模型。因此,如何在一个模型中同时实现长序列上下文、碱基分辨率预测和多模态覆盖,是领域亟待解决的问题。

科学问题

卡在哪里: 现有模型要么牺牲分辨率换取长程上下文,要么专注于单一模态而无法全面刻画变异的多效性。例如,Enformer和Borzoi的输出分辨率为128 bp或32 bp,模糊了剪接位点等精细特征;而SpliceAI、ChromBPNet等专用模型虽分辨率高,但输入序列短,且无法同时预测多种分子表型。此外,尚无模型能够直接预测剪接点(splice junction)的定量使用,这限制了对剪接变异效应的全面评估。

本文要回答: 开发一个统一的序列到功能模型,以1 Mb DNA序列为输入,同时预测多种功能基因组轨道至单碱基分辨率,并在变异效应预测上超越现有最优模型。

技术路线

作者主要用了:深度学习、U-Net架构、Transformer、序列并行、蒸馏、多模态训练

AlphaGenome采用U-Net启发的编码器-解码器架构,输入1 Mb DNA序列,通过卷积层捕获局部序列模式,Transformer块建模长程依赖,并利用序列并行在8个TPU上实现碱基分辨率训练。模型输出两类表示:一维嵌入用于线性基因组轨道预测(1 bp和128 bp分辨率),二维嵌入用于染色质接触图预测(2,048 bp分辨率)。训练分两阶段:先进行4折交叉验证预训练,再用全部数据训练教师模型,最后通过蒸馏得到单一学生模型,该学生模型在输入序列随机突变增强下训练,以提高变异效应预测的鲁棒性。蒸馏后的模型可在单个GPU上快速进行变异效应预测。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示AlphaGenome整体框架:输入1 Mb DNA序列和物种身份,输出5,930个人类或1,128个小鼠基因组轨道,涵盖11种输出类型。模型采用U-Net架构,编码器下采样,Transformer块跨设备通信,解码器上采样,最后接任务特定输出头。训练分预训练和蒸馏两阶段。性能总览显示AlphaGenome在22/24轨道预测和25/26变异效应预测基准上超越外部模型。

核心亮点

亮点 1|基因组轨道预测全面领先

在涵盖11种模态的24项基因组轨道预测基准中,AlphaGenome在22项上超越最强外部模型。例如,与多模态模型Borzoi相比,细胞类型特异性基因表达log-fold change预测相对提升14.7%;与专用模型Orca相比,接触图Pearson r提升6.3%;与ProCapNet相比,转录起始轨道总计数Pearson r提升15%;与ChromBPNet相比,ATAC和DNase谱Jensen-Shannon散度分别提升1.6%和9.5%。在人类和小鼠基因组上,预测与观测信号均呈现高Pearson相关性。这些结果表明AlphaGenome在基础轨道预测上已具备高保真度,为变异效应预测奠定了坚实基础。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示AlphaGenome在人类chr19一个1 Mb留出区域上的预测与观测轨道对比(HepG2细胞系)。预测的RNA-seq、ATAC-seq、DNase-seq等轨道与实验数据高度一致,包括链特异性和碱基分辨率细节。定量评估显示人类和小鼠基因组上预测与观测信号Pearson相关性高,但细胞类型特异性表达偏差的预测仍具挑战性。

亮点 2|剪接变异预测达到新水平

AlphaGenome同时预测剪接位点、剪接位点使用和剪接点,并开发了统一剪接变异评分器。在7项剪接相关基准中,6项达到最优。例如,在GTEx sQTL分类中,AlphaGenome优于Pangolin等专用模型;在ClinVar致病性区分中,深内含子和同义变异auPRC为0.66(对比Pangolin 0.64),剪接区域auPRC为0.57(对比Pangolin 0.55),错义变异auPRC为0.18(对比DeltaSplice和Pangolin 0.16)。在MFASS大规模平行剪接报告实验中,AlphaGenome auPRC为0.51,略低于Pangolin的0.54,但超过SpliceAI和DeltaSplice。值得注意的是,仅使用剪接点评分器就在多数基准上超越以往方法,凸显了直接建模剪接点的重要性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3聚焦剪接变异预测。a比较不同深度学习模型的输出类型和分辨率;b展示DLG1基因外显子跳跃变异,AlphaGenome预测的剪接位点使用、剪接点和RNA-seq覆盖与GTEx观测一致;c展示COL6A2新剪接点变异;d展示U2SURP外显子9的ISM分析,揭示剪接相关基序;e-i展示统一剪接评分器在sQTL、剪接异常值、ClinVar和MFASS基准上的性能,AlphaGenome在多数任务上达到最优。

亮点 3|eQTL效应预测大幅提升

在GTEx精细定位eQTL上,AlphaGenome的效应大小预测Spearman ρ从Borzoi的0.39提升至0.49,方向预测auROC从0.75提升至0.80。在90%方向预测准确率阈值下,AlphaGenome能恢复41%的eQTL,而Borzoi仅恢复19%。在GWAS可信集分析中,AlphaGenome为49%的可信集分配了至少一个变异的方向预测(使用80%准确率阈值),与共定位方法COLOC互补,尤其在低频变异中,AlphaGenome解析的可信集数量约为COLOC的4倍。此外,利用AlphaGenome多模态评分训练随机森林,eQTL因果性auROC从0.68提升至0.75,超过Borzoi的0.71。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示基因表达变异效应预测。a为eQTL变异评分策略;b展示rs9610445变异,AlphaGenome预测APOL4表达下降,ISM显示剪接供体基序破坏;c-g显示AlphaGenome在eQTL效应大小和方向预测上超越Borzoi,并在高置信度阈值下恢复更多eQTL;h显示AlphaGenome与COLOC在GWAS可信集方向预测上互补;i显示多模态特征提升eQTL因果性预测;j显示AlphaGenome在增强子-基因连接预测上零样本性能接近ENCODE-rE2G扩展模型;k显示AlphaGenome在paQTL预测上优于Borzoi。

亮点 4|染色质QTL预测超越专用模型

在多种族caQTL、dsQTL和bQTL基准上,AlphaGenome在因果性(平均精度)和效应大小(Pearson r)方面均优于Borzoi和专用模型ChromBPNet。例如,在非洲裔caQTL中,GM12878 DNase预测与观测效应大小的Pearson r达到0.74;在SPI1 bQTL中,Pearson r为0.55。ISM分析显示,高影响变异附近的预测变化与NF-κB等转录因子基序的改变相对应。在CAGI5 MPRA饱和诱变挑战中,整合多模态和多细胞类型特征的LASSO模型Pearson r达到0.65,超越所有对比模型。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示染色质可及性和结合QTL预测。a为中心掩码变异评分策略;b-c显示AlphaGenome在QTL因果性和效应大小预测上优于Borzoi和ChromBPNet;d-g展示具体QTL示例的预测与观测效应大小相关性;h-i显示ISM揭示SPI1基序改变;j显示AlphaGenome在CAGI5 MPRA挑战中通过多模态特征整合达到Pearson r=0.65的最优性能。

亮点 5|多模态视角解析TAL1致癌变异

AlphaGenome在CD34+ CMP细胞中预测TAL1致癌变异chr.1:47239296 C>ACG导致H3K27ac和H3K4me1增加、H3K9me3和H3K27me3减少、H3K36me3升高以及TAL1 mRNA表达上调,与实验观察一致。ISM揭示该变异引入MYB基序,并发现一个未知功能的ETS样基序。与打乱对照相比,致癌变异在TAL1表达上预测增加更显著,且多模态效应模式在无监督聚类中与对照明显分离。这些效应在胸腺、CMP等T-ALL相关组织中最为突出。

亮点 6|消融实验揭示关键设计选择

消融研究表明:1 bp分辨率训练对剪接(PSI5/PSI3)和可及性(ATAC)任务至关重要,而接触图和组蛋白ChIP-seq相关性对分辨率不敏感;训练和推理使用1 Mb全长序列均优于较短序列,且1 Mb训练的模型在短上下文推理时仍具竞争力;蒸馏能获得与4模型集成相当或更好的性能,且输入序列随机突变增强对变异效应预测有显著贡献;多模态学习总体上优于单模态,但收益因任务而异,例如eQTL预测从多模态中获益最大,而可及性变异预测仅用可及性数据即可达到较好效果。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 深度学习、U-Net架构、Transformer、序列并行、蒸馏、多模态训练
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事调控基因组学、变异效应预测或深度学习模型开发的研究者。

带走一句

AlphaGenome证明长序列、碱基分辨率和多模态可以统一在一个模型中,蒸馏策略使单模型推理高效,为变异效应预测提供了新基准。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。