IF46.9|moPepGen:图算法全面解析非经典肽
moPepGen用图算法在分钟级生成非经典肽库,让多组学蛋白质组鉴定更全面。
moPepGen用图算法在分钟级生成非经典肽库,让多组学蛋白质组鉴定更全面。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
蛋白质组学中,一个DNA序列可通过遗传变异、转录后修饰、选择性剪接和RNA环化等产生多种蛋白产物,即非经典肽。传统方法如de novo测序和开放搜索虽能发现非经典肽,但计算昂贵、假阴性率高。因此,多数蛋白质基因组学研究采用包含DNA和RNA变异的定制数据库,通过样本特异性搜索空间来降低错误率。然而,现有数据库生成工具往往只针对单一变异类型,无法全面模拟基因表达的复杂性,导致漏检。
科学问题
卡在哪里: 现有非经典肽数据库生成工具通常只考虑单一变异类型(如SNV、indel或融合),无法同时整合多种变异及组合,且计算复杂度高,难以处理大规模数据。这导致许多由复杂变异组合产生的非经典肽被遗漏,假阴性率高。
本文要回答: 开发一个能全面、高效地生成非经典肽数据库的算法,以支持多物种、多技术平台的蛋白质基因组学研究。
技术路线
作者主要用了:图算法、转录本变异图、肽变异图、肽切割图、模糊测试、多组学数据整合。
作者开发了moPepGen,一种基于图的多组学肽生成算法。它通过构建转录本变异图(TVG)、肽变异图(PVG)和肽切割图(PCG)三个层次的图,系统整合SNV、indel、RNA编辑、选择性剪接、基因融合和circRNA等变异类型,并在所有阅读框中进行翻译和切割模拟。算法采用分阶段调用和弹出-折叠策略优化性能,能在线性时间内枚举所有可能的非经典肽。随后,作者用模糊测试验证了算法的准确性和线性复杂度,并在多个真实数据集上进行了基准测试和应用。

图 1 Fig. 1。图1展示了moPepGen的算法框架和性能。a部分显示moPepGen基于图结构整合多种变异类型(SNV、indel、RNA编辑、选择性剪接、融合、circRNA)并生成非经典肽库。b和c部分通过模糊测试表明moPepGen的运行时间随变异数量线性增长,而暴力算法呈指数增长,验证了其高效性。
核心亮点
亮点 1|算法性能与准确性验证
moPepGen通过100万次模糊测试验证,与暴力算法相比,肽预测完全准确,且运行时间随变异数量线性增长(每个变异4.7×10^-3秒),而暴力算法呈指数增长。在人类种系多态性数据库生成中,moPepGen仅用3.2小时和15GB内存完成,暴力算法无法完成。与customProDBJ和pyQUILTS比较,moPepGen在简单变异上灵敏度略高,在复杂变异(选择性剪接、RNA编辑、环化、融合)上独有80.2%的肽,并唯一检测到53.7%的匹配肽。

图 2 Fig. 2。图2展示了moPepGen在癌细胞系和前列腺癌中的应用。a部分显示不同组织来源的细胞系中预测的变异肽数量差异很大,中位数从838到16,255不等。b部分显示26个基因的变异肽在多个组织来源的细胞系中重复检测,包括TP53、KRAS和HRAS。c部分显示前列腺癌样本中moPepGen生成的变异肽涵盖115种变异组合类别,体现了其全面性。
亮点 2|多蛋白酶与多物种应用
在人类扁桃体样本中,moPepGen结合七种蛋白酶鉴定到1,787个来自非编码转录本的ORF肽,其中Arg-C蛋白酶效果最佳,184个ORF在四种以上方法中重复检测。在小鼠C57BL/6N中,利用种系变异预测了5,481个编码基因变异肽和15,475个非编码ORF肽,在三个组织中检测到18个编码变异肽和343个非编码ORF肽,证明moPepGen支持非人类物种的蛋白质基因组学。
亮点 3|癌细胞系体细胞变异肽检测
在375个CCLE细胞系中,moPepGen每个细胞系平均2分58秒生成2,683个变异肽。蛋白质组搜索检测到每个细胞系39个非经典肽,主要来自非编码ORF。26个基因的变异肽在三个以上组织来源的细胞系中重复检测,包括TP53、KRAS和HRAS等驱动基因。通过Prosit预测谱图验证,变异肽的谱图相关性高于其经典对应物。此外,检测到的变异肽预测出416个潜在新抗原,包括KRAS、TP53和FUBP3中的重复新抗原。
亮点 4|DIA蛋白质组学与复杂变异整合
在8个透明细胞肾细胞癌DIA数据中,moPepGen预测每个肿瘤157,016个变异肽,利用Prosit谱库和DIA-NN检测到307个变异肽,主要来源于种系SNP和选择性剪接,RNA编辑肽在21个基因中检测到。在5个前列腺癌样本中,整合WGS、RNA-seq和蛋白质组数据,moPepGen生成1,382,666个变异肽,检测到206个非经典肽,其中138个来自编码基因。检测到多个变异组合肽,包括KLK3(PSA)的两个多变异肽,以及9个基因的circRNA来源肽,其中36/78个circRNA PSM通过de novo测序验证。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 图算法、转录本变异图、肽变异图、肽切割图、模糊测试、多组学数据整合
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事蛋白质基因组学、肿瘤新抗原发现或多组学整合分析的生物信息学研究人员。
带走一句
moPepGen提供了一个高效、全面的非经典肽数据库生成方案,可无缝整合多组学数据,显著提升蛋白质基因组学研究的覆盖度和准确性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。