IF36.1|CHIMERYS统一解析嵌合谱的蛋白质组学算法
一个算法通吃DDA、DIA和PRM,嵌合谱解卷积大幅提升鉴定深度。
一个算法通吃DDA、DIA和PRM,嵌合谱解卷积大幅提升鉴定深度。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
自下而上蛋白质组学依赖LC-MS/MS产生海量MS2谱图,但大多数谱图是嵌合的,即包含多个肽段的碎片离子。传统上,DDA数据采用以谱图为中心的搜索引擎,而DIA和PRM数据则采用以肽段为中心的方法,依赖谱图库。这两种分析范式割裂,难以公平比较。嵌合谱的存在使得经典搜索引擎在共享碎片离子处理上存在缺陷,而DIA分析中FDR控制仍具挑战。近年来,深度学习预测肽段保留时间和碎片离子强度已取得高精度,为统一分析提供了可能。
科学问题
卡在哪里: 现有软件要么针对DDA,要么针对DIA/PRM,缺乏一个统一的、以谱图为中心的算法,能够同时处理所有数据采集模式,并在嵌合谱中准确分配共享碎片离子,同时保持严格的FDR控制。
本文要回答: 开发一个统一的谱图中心算法CHIMERYS,通过解卷积嵌合谱,实现DDA、DIA和PRM数据的无差别鉴定与定量,并验证其性能。
技术路线
作者主要用了:谱图解卷积、非负L1正则化回归、深度学习预测、mokapot FDR控制。
CHIMERYS将嵌合谱视为纯肽段谱的线性组合,利用INFERYS预测的碎片离子强度和保留时间,通过LASSO回归在单张谱图中同时竞争解释实验强度,从而解卷积出多个肽段。随后,基于解卷积系数计算阴影谱,进行二次打分,并利用mokapot进行PSM级FDR控制。该算法无需谱图库,直接处理DDA、DIA和PRM数据,实现统一分析。

图 1 Fig. 1。图1展示CHIMERYS的核心原理和性能验证。a示意嵌合谱解卷积的线性组合模型;b显示在不同隔离窗口宽度下,CHIMERYS的肽段组q值与entrapment经验q值一致,证明FDR控制可靠;c展示一个嵌合谱中6个前体的解卷积结果,共享碎片离子强度按系数分配;d显示多物种混合实验中定量比例符合预期;e比较CHIMERYS与8种搜索引擎的肽段组鉴定数,CHIMERYS显著领先。
核心亮点
亮点 1|DDA鉴定深度大幅提升
在2小时HeLa单针DDA数据中,CHIMERYS鉴定到238,795个PSM(1% PSM FDR),超过85%的MS2谱图得到至少一个PSM,其中超过三分之二的谱图包含多个前体。与8种常用搜索引擎相比,CHIMERYS鉴定到更多肽段组,且运行时间短于数据采集时间。在多种困难样本(尿液、CSF、血浆、FFPE、分泌组、植物和微生物)以及PTM富集样本中,CHIMERYS的蛋白组或前体鉴定数均显著高于Sequest HT和MSFragger。

图 2 Fig. 2。图2展示CHIMERYS在历史数据和低分辨数据上的优势。a显示不同Orbitrap世代仪器上CHIMERYS相对Sequest HT的PSM鉴定增益,仪器越新增益越大;b显示离子阱CID数据中,CHIMERYS在原始谱和top 15滤波谱上均大幅超越Sequest HT,滤波后优势更明显;c显示30分钟梯度CHIMERYS与120分钟梯度Sequest HT鉴定量相当,通量提升4倍;d,e显示宽窗口DDA中PSM数随窗口增大而增加,但独特肽段组在3.4 Th后下降。
亮点 2|重新挖掘历史数据
对跨越多年Orbitrap仪器世代的HeLa单针数据回顾分析显示,仪器速度和灵敏度越高,CHIMERYS相对Sequest HT的优势越大。在低分辨离子阱数据中,CHIMERYS比Sequest HT多鉴定74%的PSM、35%的肽段组和30%的蛋白组;若先对谱图进行top 15 by 100-Th滤波,优势进一步扩大至94%、47%和37%。这表明CHIMERYS能从嵌合谱中提取更多信息,提升历史数据的价值。

图 3 Fig. 3。图3比较CHIMERYS、DIA-NN和Spectronaut在DIA数据上的鉴定和FDR控制。a显示在entrapment FDR过滤后,CHIMERYS的鉴定数不变,而DIA-NN和Spectronaut大幅减少,数据完整性下降;b,c显示被过滤掉的前体具有更低的MS2强度和更少的碎片离子;d展示Spectronaut中一个高置信前体实际碎片离子缺失的案例,说明其FDR控制过于宽松。
亮点 3|优化采集策略
利用CHIMERYS的解卷积能力,可以缩短梯度提高通量:30分钟梯度(48 SPD)鉴定到的肽段和蛋白组数量与Sequest HT在120分钟梯度(12 SPD)相当,通量提升4倍。在宽窗口DDA中,随着隔离窗口从1.4 Th增加到20.4 Th,PSM数量增加并在>8 m/z后趋于平台,但独特肽段组在3.4 Th达到峰值后下降,提示高丰度肽段被重复采样。对于低上样量样本,禁用AGC限制并延长注入时间可使CHIMERYS在极宽窗口下检测到更多独特肽段。

图 4 Fig. 4。图4展示CHIMERYS的MS2定量概念和性能。a示意CHIMERYS基于谱图中心系数追踪生成伪XIC,与常规碎片离子XIC方法对比;b显示PRM数据中CHIMERYS与Skyline定量高度相关(r=0.99);c显示DIA数据中三款软件的CV分布相似;d显示三款软件的前体比值分布一致,定量准确性相当。
亮点 4|DIA分析性能与FDR控制
在LFQbench型多物种混合DIA数据中,CHIMERYS平均每个原始文件鉴定529,993个PSM(1% PSM FDR),映射到66,888个独特肽段组和7,331个独特蛋白组,鉴定率超过60%,超过82%的谱图包含多个前体。与DIA-NN和Spectronaut相比,CHIMERYS的自报q值与entrapment经验q值一致,而另外两者低估FDR。在应用entrapment FDR过滤后,CHIMERYS的数据完整性(41%)保持不变,而Spectronaut从86%降至61%,DIA-NN从78%降至30%。

图 5 Fig. 5。图5展示CHIMERYS在DI-SPA数据上的优势。a-c显示在不同Q1隔离宽度、最大注入时间和MS2分辨率条件下,CHIMERYS(蓝色)比CsoDIAq(绿色)鉴定到更多肽段组;d显示CHIMERYS与CsoDIAq的鉴定数比值;e显示蛋白组鉴定数同样大幅领先;f,g显示CHIMERYS灵敏度约高2倍;h显示CHIMERYS显著富集更多KEGG通路。
亮点 5|MS2定量精度与PRM自动化
CHIMERYS基于谱图中心系数追踪保留时间生成伪XIC,实现MS2定量。在PRM实验中,CHIMERYS与Skyline均鉴定到52个目标肽段中的47个,且定量结果高度相关(Pearson r=0.99)。在DIA数据中,CHIMERYS的定量精度(CV中位数26.9%)与DIA-NN(29.1%)和Spectronaut(29.2%)相当,定量准确性也相似。CHIMERYS自动处理共享碎片离子和共分离肽段,无需手动校正,简化了PRM流程。
亮点 6|直接进样DI-SPA分析
CHIMERYS是唯一能分析DI-SPA数据的无谱图库算法。在重新分析Meyer等人的88个DI-SPA MCF7样本时,使用匹配诱饵后,CHIMERYS比专用工具CsoDIAq多鉴定高达3倍的独特肽段组和蛋白组,灵敏度约高2倍。这导致显著富集的KEGG通路从8条增加到17条,覆盖更多蛋白鉴定,揭示了先前数据中隐藏的生物学信息。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 谱图解卷积、非负L1正则化回归、深度学习预测、mokapot FDR控制
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事蛋白质组学数据分析、方法开发或软件评测的研究人员。
带走一句
嵌合谱解卷积是提升蛋白质组鉴定深度的关键,统一算法可简化流程并保证FDR可靠。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。