IF50.5|基因组语言模型实现全新功能基因的语义设计
用Evo模型从基因组上下文直接生成有功能的全新基因,成功率最高达50%。
用Evo模型从基因组上下文直接生成有功能的全新基因,成功率最高达50%。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
生成式AI在生物系统设计上潜力巨大,但如何让模型理解并生成具有特定功能的序列仍是一大难题。在自然语言处理中,分布语义学认为词语的含义可由其共现的上下文推断。类似地,在原核生物基因组中,功能相关的基因常成簇排列,形成操纵子或防御岛,这种“共现即相关”的规律已被用于基因功能发现。然而,现有生成模型大多只学习单个基因或蛋白序列,缺乏对基因间关系的建模,难以直接利用基因组上下文进行功能导向的设计。本研究探索了基因组语言模型Evo能否学习这种分布语义,从而通过提示工程实现全新功能基因的生成。
科学问题
卡在哪里: 现有生成模型通常需要结构先验、进化保守信息或任务特异性微调,且生成序列往往局限于已知序列空间。如何仅凭基因组上下文信息,引导模型生成具有预期功能且序列高度新颖的基因,仍是一个未被解决的挑战。
本文要回答: 验证Evo能否利用基因组上下文进行功能导向的序列生成,并评估其在毒素-抗毒素系统和anti-CRISPR蛋白等快速进化系统中的设计能力。
技术路线
作者主要用了:Evo 1.5基因组语言模型、语义设计、生长抑制/拯救实验、PaCRISPR、AlphaFold 3。
作者首先验证Evo 1.5能利用基因组上下文完成基因和操纵子序列的“自动补全”,证明模型学到了基因间的分布语义。然后,他们以毒素-抗毒素系统和anti-CRISPR系统为测试案例,设计提示策略:用已知功能的基因或基因组上下文作为提示,让模型生成新序列,再通过计算过滤和实验验证筛选出有功能的候选。最后,他们大规模生成序列构建了SynGenome数据库,并分析其功能关联。

图 1 Fig. 1。图1展示了语义设计的概念和Evo 1.5的序列补全能力。a部分对比自然语言中的分布语义与基因组中的基因共现关系。b部分说明Evo如何将功能相关基因映射到相似的语义空间。c部分显示Evo 1.5在三个保守基因的补全任务中均优于Evo 1 131K和Evo 1 8K,尤其在低提示长度下优势明显。
核心亮点
亮点 1|Evo 1.5实现基因和操纵子的上下文补全
Evo 1.5在仅提供30%基因序列时,对rpoS的氨基酸序列恢复率达85%,优于Evo 1 131K的65%。在操纵子水平,用上游或下游基因作提示,模型能预测相邻基因序列,蛋白序列恢复率超过80%。熵分析显示,模型在保守位置熵低,在可变位置熵高,且氨基酸替换偏向保守,说明模型并非简单记忆训练序列,而是学习了进化约束。

图 2 Fig. 2。图2展示了毒素-抗毒素系统的语义设计流程和实验结果。a部分说明从毒素生成到抗毒素生成的策略。b部分比较II型和III型系统的机制。c部分显示EvoRelE1与最接近天然蛋白的结构对比。d部分展示EvoRelE1的毒性及EvoAT1-4和EvoAT6的拯救效果。e-h部分显示抗毒素的序列保守性、交叉中和活性及与天然蛋白的低序列同一性。i-k部分展示EvoT1的毒性和EvoAT6的序列与结构特征。
亮点 2|语义设计生成新型毒素-抗毒素系统
作者用Evo 1.5生成了II型毒素EvoRelE1(与已知RelE毒素71%序列同一性),并以其为提示生成抗毒素,10个候选中有5个能拯救生长(成功率50%)。其中EvoAT1和EvoAT2恢复生长至95-100%,且EvoAT2和EvoAT4能交叉中和多种天然毒素。EvoAT1-4与天然蛋白序列同一性仅21-27%,但结构预测显示与EvoRelE1有高置信复合物形成。此外,还生成了III型RNA抗毒素EvoAT6,能中和ToxN(88%相对存活率),以及无显著相似性的毒素EvoT1。

图 3 Fig. 3。图3展示了anti-CRISPR蛋白的语义设计。a部分说明Acr与aca基因的共定位。b部分展示提示策略。c部分显示PaCRISPR对生成序列的富集。d部分展示生成Acr的序列多样性。e部分为实验流程。f-g部分显示EvoAcr1-5在液体培养和噬菌体感染实验中的保护效果。h-k部分展示EvoAcr1和EvoAcr2与已知蛋白无显著相似性,而EvoAcr3-5与已知蛋白有一定相似性。
亮点 3|语义设计生成de novo anti-CRISPR蛋白
以已知Acr基因组上下文为提示,Evo 1.5生成的序列经PaCRISPR预测有显著富集。实验测试84个候选,17%表现出Acr活性。其中EvoAcr1和EvoAcr2与任何已知蛋白无显著序列或结构相似性,但能有效保护大肠杆菌免受SpCas9切割(相对存活率0.82和0.74)。EvoAcr3与sigma-70因子有微弱相似性,但功能为Acr。EvoAcr4和EvoAcr5则与已知Acr有一定相似性。这些结果表明语义设计能生成高度新颖的功能蛋白。

图 4 Fig. 4。图4展示了SynGenome数据库的构建和特征。a部分说明提示来源和生成流程。b部分显示数据库规模。c部分显示生成序列与提示序列的密码子使用相似。d部分展示Leiden聚类中生成序列与提示序列的混合情况。e-g部分显示生成ORF长度分布和Pfam结构域频率与天然序列一致。h-i部分展示结构域关联网络重现已知共定位关系并为DUF提供功能假设。j部分展示可能的新结构域融合蛋白。
亮点 4|SynGenome:1200亿碱基对的AI生成基因组数据库
作者用Evo 1.5对170万个原核和噬菌体基因的上下游及编码序列进行提示,生成了超过1200亿碱基对的合成DNA序列,并构建了可搜索的SynGenome数据库。分析显示,生成的ORF长度分布与天然原核生物相似,Pfam结构域频率与天然序列高度相关(Pearson r=0.78)。通过构建结构域关联网络,发现SynGenome能重现已知的基因组共定位关系,并为DUF2871等功能未知结构域提供功能假设。此外,还发现了可能的新结构域融合蛋白。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: Evo 1.5基因组语言模型、语义设计、生长抑制/拯救实验、PaCRISPR、AlphaFold 3
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事蛋白质设计、合成生物学、基因组挖掘和生成模型研究的科研人员。
带走一句
语义设计利用基因组上下文作为功能提示,无需结构先验或微调即可生成高度新颖的功能基因,为蛋白质设计提供了全新思路。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。