IF36.1|SAVANA:长读长测序可靠检测体细胞结构变异与拷贝数异常
长读长测序终于有了能同时兼顾灵敏度和特异性的体细胞SV检测算法。
长读长测序终于有了能同时兼顾灵敏度和特异性的体细胞SV检测算法。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
癌症基因组中结构变异(SV)和体细胞拷贝数异常(SCNA)是驱动肿瘤发生的关键因素。短读长测序受限于读长,难以解析重复区域和复杂重排,导致癌症SV图谱不完整。长读长测序(如ONT、PacBio)可跨越重复区域,但早期算法特异性差,产生大量假阳性。已有算法如Sniffles2、cuteSV、SVIM等主要针对胚系SV设计,用于体细胞检测时性能未知。缺乏大规模长读长癌症数据集和公正的基准测试方法,使得长读长测序在癌症SV检测中的真实价值难以评估。
科学问题
卡在哪里: 现有长读长SV检测算法在体细胞变异检测中特异性差,产生大量假阳性,且缺乏无偏的基准测试方法。小规模真值集存在区域偏倚,无法评估特异性。因此,长读长测序相比短读长测序在癌症SV检测中的真实增益仍不清楚。
本文要回答: 开发一种高灵敏度和高特异性的长读长体细胞SV和SCNA检测算法,并建立无偏的基准测试方法,系统评估长读长测序在癌症基因组分析中的优势。
技术路线
作者主要用了:长读长测序、机器学习、随机森林、Mondrian共形预测、复制基准测试、单倍型分型。
作者开发了SAVANA算法,利用机器学习区分真实体细胞SV与测序/比对错误。首先在99对肿瘤-正常样本上同时进行纳米孔和Illumina全基因组测序,构建高质量训练集。然后通过模拟测序重复和读段支持相位分析,建立无偏的基准测试框架。最后在临床样本上验证SAVANA检测癌症驱动SV和SCNA的能力,并与现有算法进行全面比较。

图 1 Fig. 1。图1展示了SAVANA的整体分析流程,包括从长读长测序数据中检测体细胞SV、SCNA以及估计肿瘤纯度和倍性。右侧示例显示了一个复杂基因组重排图谱,总拷贝数和次要等位基因拷贝数分别用黑色和蓝色表示,展示了SAVANA在解析复杂重排方面的能力。
核心亮点
亮点 1|SAVANA特异性比第二名高13倍
通过读段支持相位分析,SAVANA报告的SV中仅0.15%(19/12749)显示不一致的相位支持,而Sniffles2在双重复中检测到的SV有25%显示不一致相位支持(166倍差异)。这表明SAVANA能有效区分真实体细胞SV与假阳性。

图 2 Fig. 2。图2通过模拟测序重复策略评估各算法的SV检测一致性。b图显示不同算法检出的SV数量差异巨大,且仅在单个重复中检出的SV比例各异。c图显示SAVANA在双重复中的SV一致性显著高于其他算法。d-f图进一步表明SAVANA在不同等位基因频率、SV类型和重复区域中均保持高一致性。g-h图显示SAVANA检出的SV几乎全部由单一单倍型支持,而其他算法存在大量不一致相位支持的SV。
亮点 2|SAVANA灵敏度全面领先
在83个肿瘤样本中,SAVANA平均检测到86%的Illumina短读长测序检出的SV,而其他算法的召回率显著更低(P<0.001)。SAVANA还检测到92%(71/77)的短读长测序检出的癌症驱动基因SV。

图 3 Fig. 3。图3利用正常样本重复实验量化各算法的假阳性率。b图显示在COLO829BL细胞系中,SAVANA仅报告5个假阳性SV,而其他算法假阳性数量从66到2737不等。d图显示在模拟重复的正常样本中,SAVANA的假阳性率显著低于其他算法(P<0.0001),进一步证实其高特异性。
亮点 3|长读长测序发现短读长遗漏的驱动SV
SAVANA还检测到复杂的重排模式,如导致CDKN2A、NF1、TP53或RB1失活的染色体碎裂事件,以及骨肉瘤中CDK4、MDM2、CCNE1和MYC的扩增,胶质母细胞瘤中MYC和EGFR的扩增。

图 4 Fig. 4。图4比较了短读长和长读长测序在代表性肿瘤样本中的SV和拷贝数图谱。a图显示GRIDSS2/PURPLE在短读长数据中检测到的SV和拷贝数变化。b-h图显示SAVANA、Severus、NanomonSV、SVision-pro、SVIM、Sniffles2和cuteSV在长读长数据中的检测结果。SAVANA的结果与短读长高度一致,而其他算法存在大量假阳性SV,且遗漏了短读长检出的真实SV。
亮点 4|肿瘤纯度和倍性估计与短读长高度一致
在无匹配正常样本的肿瘤纯模式中,SAVANA也能以相当的准确度推断等位基因特异性拷贝数、肿瘤纯度和倍性,并保持对短读长检出的SV的高召回率。

图 5 Fig. 5。图5展示了各算法对短读长检出的高质量体细胞SV的召回率。a图显示SAVANA平均召回86%的短读长SV,显著高于其他算法。b-c图显示其他算法检出的SV中仅不到50%能在短读长数据中得到验证。d-f图展示了SAVANA检测到的复杂重排和驱动基因扩增事件,如CDKN2A、NF1、TP53或RB1的失活以及CDK4、MDM2、CCNE1和MYC的扩增。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 长读长测序、机器学习、随机森林、Mondrian共形预测、复制基准测试、单倍型分型
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/cortes-ciriano-lab/savana.
- 谁该点开原文: 从事癌症基因组学、长读长测序数据分析或SV检测算法开发的生信研究人员。
带走一句
长读长测序做癌症SV分析,SAVANA是目前最可靠的选择;做基准测试时,用测序重复和读段相位分析比小规模真值集更无偏。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。