IF36.1|DIA蛋白质组工具FDR控制普遍失效
用entrapment框架系统评估主流DIA工具,发现蛋白水平FDR控制几乎全部失效。
用entrapment框架系统评估主流DIA工具,发现蛋白水平FDR控制几乎全部失效。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
在基于质谱的蛋白质组学中,控制报告蛋白、肽段或肽谱匹配(PSM)的错误发现率(FDR)至关重要。最常用的FDR控制程序是目标-诱饵竞争(TDC),将谱图搜索到由真实(目标)和打乱或反转(诱饵)肽段组成的数据库。理想情况下,这些程序应控制实际错误发现比例(FDP),但FDP无法直接测量,只能控制其期望值FDR。然而,许多分析流程实现的TDC变体可能无法控制FDR,例如PSM水平的TDC控制本身就有问题,而使用Percolator或PeptideProphet等半监督分类算法进行重排序也可能破坏FDR控制。FDR控制失效会导致科学结论无效,并影响工具比较和平台选择。因此,需要严格的程序来评估蛋白质组学分析流程的FDR控制有效性。
科学问题
卡在哪里: 评估FDR控制的标准方法是entrapment程序,但已发表的entrapment实验使用了多种估计方法,其中一些作为上界或下界估计是无效的,或者被错误使用,导致结论可能不正确。具体来说,常用的combined方法常被错误地去掉1/r项而变成下界,无法证明FDR控制;sample方法则既不能证明控制也不能证明失败。此外,对于DIA工具,缺乏系统性的FDR控制评估,尤其是蛋白水平。
本文要回答: 本文旨在建立一个正式的entrapment实验框架,严格刻画不同估计方法的性质,提出更强大的评估方法,并应用这些方法评估现有DDA和DIA工具的实际FDR控制效果。
技术路线
作者主要用了:entrapment、FDR控制、DDA/DIA、蛋白质组学。
作者首先从理论上分析了三种常见的entrapment FDP估计方法:combined(上界)、lower bound(下界)和sample(无效),并提出了新的paired方法,该方法利用目标-诱饵配对信息,提供更紧的上界。然后,他们使用已知蛋白混合物的ISB18数据集进行受控实验,验证了各估计方法的性质,并通过双重entrapment实验独立评估了估计的准确性。接着,在HEK293 DDA数据上验证了paired方法能提供FDR控制的证据,而combined方法过于保守。最后,将框架应用于10个DIA数据集,评估DIA-NN、Spectronaut和EncyclopeDIA在肽段/前体和蛋白水平的FDR控制。

图 1 Fig. 1。图1展示了entrapment实验的示意图和三种可能的结果。a部分说明了典型的entrapment方法:将目标数据库与entrapment序列合并,搜索工具产生排序的肽段列表,entrapment方法利用隐藏的标签估计FDP。b部分展示了上界和下界估计如何用于判断FDR控制:如果上界低于对角线,则支持FDR控制;如果下界高于对角线,则表明FDR控制失败;否则实验不确定。
核心亮点
亮点 1|文献综述揭示entrapment误用
作者调查了已发表的entrapment研究,发现许多研究错误使用了估计方法。例如,一些研究使用lower bound方法(公式2)来证明FDR控制,但该方法只能提供下界,不能作为FDR控制的证据。另一些研究使用sample方法(公式3),该方法既不能证明FDR控制也不能证明失败。只有三项研究正确使用了entrapment估计,且都集中在DDA分析。这种误用可能导致对工具性能的错误结论。

图 2 Fig. 2。图2比较了不同entrapment估计方法在ISB18受控数据集上的表现。a部分显示,当原始目标数据库仅包含ISB18肽段时,paired方法估计的FDR曲线紧贴对角线,而combined方法的95%覆盖带完全位于对角线上方,表明combined方法过于保守。b部分在双重entrapment实验中,paired和combined方法与直接估计非常一致,而sample方法严重低估。
亮点 2|paired方法提供更紧的上界
作者提出了paired估计方法(公式4),利用每个目标肽段与唯一entrapment肽段的配对信息,在保持上界性质的同时减少保守性。在ISB18受控实验中,paired方法估计的FDR曲线紧贴对角线,而combined方法的95%覆盖带完全位于对角线上方,表明paired方法能提供FDR控制的证据,而combined方法不能。在双重entrapment实验中,paired和combined方法都与直接估计非常一致,而sample方法严重低估。

图 3 Fig. 3。图3展示了在HEK293 DDA数据上,四种搜索工具(Tide、Sage、MS-GF+、MSFragger)的entrapment估计FDP。对于所有工具,paired方法估计的FDP接近对角线,表明FDR控制有效。combined方法始终高于paired方法,有时会让人怀疑FDR控制,但paired方法提供了证据。lower bound方法则始终低估FDP。
亮点 3|DDA工具FDR控制得到验证
在HEK293 DDA数据上,对Tide、Sage、MS-GF+和MSFragger进行肽段水平FDR控制评估。对于所有工具,paired方法估计的FDP接近对角线,表明FDR控制有效。combined方法始终高于paired方法,有时会让人怀疑FDR控制,但paired方法提供了证据。lower bound方法则始终低估FDP。这些结果与DDA领域共识一致,验证了框架的合理性。

图 4 Fig. 4。图4展示了DIA工具在human-lumos数据集上的FDR控制评估。a部分显示,前体/肽段水平的FDR控制不确定,而蛋白水平FDR控制明显无效:EncyclopeDIA蛋白水平FDP下界超过6%。b部分比较了DIA-NN在1% FDR阈值下报告的发现数量与使用paired方法将FDP控制在1%时得到的发现数量,显示发现数量虚高。
亮点 4|DIA工具蛋白水平FDR控制普遍失效
对10个DIA数据集的分析显示,DIA-NN、Spectronaut和EncyclopeDIA在肽段/前体水平的FDR控制经常有问题,而蛋白水平FDR控制几乎总是无效。例如,在human-lumos数据集上,EncyclopeDIA蛋白水平FDP的下界超过6%。在单细胞数据集(1cell-eclipse)上,DIA-NN前体水平FDP下界超过2.3%,Spectronaut超过3.8%。蛋白水平FDP估计也最高。这些结果表明,DIA工具在蛋白水平上无法控制FDR。
亮点 5|FDR控制失效导致发现数量虚高
作者比较了DIA-NN在1% FDR阈值下报告的发现数量与使用paired方法将FDP控制在1%时得到的发现数量。在FDP估计为1-2%的数据集上,前体水平发现数量虚高最多6.7%,蛋白水平最多4.7%。在单细胞数据集上,虚高比例高达48.3%(前体)和44.2%(蛋白)。这表明错误的FDR控制会导致大量假阳性发现被报告。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: entrapment、FDR控制、DDA/DIA、蛋白质组学
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事质谱蛋白质组学数据分析、工具开发或基准测试的研究人员。
带走一句
评估DIA工具FDR控制时,必须使用正确的entrapment估计方法;蛋白水平FDR控制普遍失效,需谨慎解读结果。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。