周启涛生物技术工作室
基因组与遗传2025/10/10· 编译自 Nature Genetics

IF31.7|核苷酸依赖图谱:从基因组语言模型挖掘功能元件

用突变扰动量化gLM预测的连锁反应,一张依赖图揭示调控元件、RNA结构甚至模型缺陷。

用突变扰动量化gLM预测的连锁反应,一张依赖图揭示调控元件、RNA结构甚至模型缺陷。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

基因组语言模型(gLMs)通过预测序列中每个核苷酸的概率来学习基因组规律,已被证明能区分功能性和非功能性转录因子结合位点,并用于变异效应预测。然而,gLMs通常作为黑箱使用,其内部表征难以解读。传统比较基因组学依赖序列比对和保守性分析来识别功能元件,但仅限于高度保守区域。gLMs无需比对即可捕捉进化模式,但如何从模型中提取可解释的功能信息仍是一个挑战。

科学问题

卡在哪里: 现有gLM研究多关注重建概率或下游任务性能,缺乏直接量化核苷酸间相互依赖关系的方法。这导致无法直观展示调控元件内部及远距离元件之间的功能耦合,也难以评估不同gLM架构和训练策略的局限性。

本文要回答: 本文旨在定义并系统分析核苷酸依赖图谱,以揭示gLM编码的功能元件及其相互作用,并利用该图谱评估和比较不同gLM。

技术路线

作者主要用了:in silico mutagenesis、核苷酸依赖图谱、变体影响评分、卷积滤波、DMS-MaPseq

作者提出核苷酸依赖度量:对序列中一个查询位点进行单核苷酸替换,计算目标位点预测概率的对数几率变化。对所有查询-目标对重复此过程,得到二维依赖图谱。首先在酵母tRNA上验证该方法能恢复二级和三级结构接触,然后系统分析依赖图谱中的块状、对角线等模式,关联到TF结合位点、剪接位点、RNA结构等。最后用依赖图谱比较不同gLM架构和训练数据的影响。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示核苷酸依赖的定义和验证。a示意gLM预测核苷酸概率;b展示通过替换查询位点计算对目标位点概率的影响;c比较变体影响评分、重建评分和保守性评分在启动子饱和突变数据上的相关性,影响评分最高且与Borzoi互补;d显示酵母精氨酸tRNA的依赖图谱,清晰呈现二级结构的四个臂和三级接触。

核心亮点

亮点 1|变体影响评分优于重建和保守性

作者定义变体影响评分为查询位点对所有目标位点依赖强度的平均值。在人类启动子饱和突变数据集(9个启动子,8,635个变体)上,该评分与基因表达变化的相关性优于gLM重建概率和PhastCons/PhyloP保守性评分,并与监督模型Borzoi相当,且二者互补。在ClinVar非编码变异和eQTL数据上也表现更好。这表明依赖强度能更准确地反映变体的功能重要性。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示依赖块与TF基序的对应关系。a中酵母SMT3启动子的依赖图谱显示TF基序处出现块状结构,而poly(dA:dT)重复没有;b展示人类启动子中Znf652、Nfy和Spdef基序的依赖块;c比较块评分与重建评分在结合位点和重复元件上的分布;d显示块评分区分结合位点的AUROC高于重建和PhastCons;e展示Abf1基序的两个分离块。

亮点 2|依赖块精准标记TF结合位点

在酵母启动子中,连续核苷酸间的强相互依赖形成沿对角线的密集块,与TF结合位点基序高度重合。作者定义块评分(连续6个核苷酸依赖的第一四分位数)来检测这些块。在68个TF的ChIP-exo数据上,块评分区分结合位点核苷酸的能力显著优于重建概率和PhastCons保守性,与PWM扫描相当,且完全无监督。此外,Abf1基序呈现两个分离的相互作用块,反映其二聚体结合特性。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示远端依赖块揭示元件间相互作用。a中果蝇GstO2启动子的依赖图谱显示TATA盒和INR之间的强依赖;b中酵母ATG44内含子的依赖图谱显示供体、分支点和受体位点间的依赖;c显示供体-受体依赖高于供体-诱饵受体和背景;d和e展示人类TRPC6基因罕见变异导致异常剪接,依赖图谱反映变异位点与新内含子边界的强依赖。

亮点 3|依赖图谱揭示RNA三级结构和假结

使用RiNALMo(RNA语言模型)计算依赖图谱,在Archive II数据库上预测二级结构接触的AUROC大多超过0.9。更重要的是,依赖图谱能捕捉非经典接触和三级结构接触:在PDB RNA结构中,依赖分数>13.5且未被监督RiNALMo预测为二级结构的碱基对中,50%为真实接触。在2,530个含假结的RNA结构中,假结接触的依赖分数显著高于非接触碱基对(AUC=0.92)。依赖图谱还能反映RNA的替代折叠构象。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示依赖图谱在RNA结构预测中的优势。a中RiNALMo依赖分数在Archive II数据库上预测二级结构接触的AUROC大多>0.9;b显示A. fulgidus tRNA的依赖图谱捕捉到三级接触,而监督RiNALMo未能预测;c和d显示依赖图谱能预测非经典接触,AUC=0.8,优于监督RiNALMo和RNAalifold;e展示RNase P RNA的假结;f展示大肠杆菌色氨酸前导序列的替代折叠。

亮点 4|依赖图谱发现新RNA结构并经实验验证

作者对大肠杆菌进行DMS-MaPseq实验,在全转录组水平验证依赖图谱预测的结构接触。进一步分析500 bp上游非编码区,发现四个先前未报道的二级结构,均得到DMS-MaPseq数据支持并通过协变分析验证。这证明依赖图谱能无监督、无需比对地预测功能相关RNA结构。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示依赖图谱捕捉重复序列。a中酵母YNR064C启动子的依赖图谱显示TATA盒的块状依赖和重复序列的平行依赖;b显示人工插入的正向和反向重复序列的平均依赖随长度增加而增加,表明gLM建模了重复操作本身。

亮点 5|依赖图谱暴露gLM架构和训练数据缺陷

比较不同gLM在人类tRNA上的依赖图谱发现:Nucleotide Transformer家族因预测非重叠6-mer而产生人为对角线块;自回归模型Evo因单向上下文在元件起始处产生伪影。更关键的是,仅在人类基因组上训练的模型无法学习tRNA结构,而多物种训练的模型即使未包含人类基因组也能捕捉部分结构。在启动子饱和突变和ClinVar数据上,单物种模型表现也较差。这表明稀有功能元件的学习需要多物种数据。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: in silico mutagenesis、核苷酸依赖图谱、变体影响评分、卷积滤波、DMS-MaPseq
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事基因组语言模型、调控元件预测、RNA结构预测或变异效应评估的生信研究者。

带走一句

核苷酸依赖图谱为gLM提供了可解释的窗口,能无监督地发现调控元件和RNA结构,并暴露模型缺陷,值得在分析流程中引入。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。