IF31.7|Locityper:复杂多态基因的靶向精准分型工具
用短读长或长读长全基因组测序,对以往难以分型的复杂基因实现高精度基因分型。
用短读长或长读长全基因组测序,对以往难以分型的复杂基因实现高精度基因分型。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
人类基因组中存在大量结构变异多态性位点,其中数百个与疾病相关的基因由于高度重复和多态性,难以通过常规变异检测方法准确分型。短读长测序虽然成本低、通量高,但在复杂区域会漏掉超过一半的结构变异;长读长测序虽能解析这些区域,但大规模队列测序成本仍然过高。已有方法如Pangenie利用泛基因组图进行变异推断,但在复杂位点因缺乏独特k-mer而受限;针对HLA、KIR等特定基因家族开发的专用工具则缺乏通用性。因此,亟需一种能够利用泛基因组参考面板,对任意复杂多态位点进行快速、准确基因分型的通用工具。
科学问题
卡在哪里: 现有变异检测流程在复杂多态位点准确性低,短读长测序难以解析高度重复区域,长读长测序成本高难以大规模应用。泛基因组参考提供了丰富的单倍型信息,但缺乏能够有效利用这些信息进行靶向基因分型的通用方法。
本文要回答: 开发一种通用靶向基因分型工具Locityper,利用泛基因组参考面板中的单倍型序列,对复杂多态基因进行快速、准确的基因分型,并适用于短读长和长读长测序数据。
技术路线
作者主要用了:全基因组测序、泛基因组参考面板、整数线性规划、模拟退火、贝塔二项分布、负二项分布。
Locityper首先从泛基因组参考面板中提取目标位点的单倍型序列,然后对全基因组测序数据进行预处理,估计插入片段大小、测序错误率和读深分布。接着利用minimizer将读段招募到目标位点,并比对到所有单倍型上。对于每个可能的基因型(单倍型对),Locityper通过整数线性规划或模拟退火优化读段分配,最大化联合似然函数,该函数综合考虑读段比对质量、插入片段大小和读深稳定性。最终选择似然最高的基因型作为预测结果,并输出读段比对到最佳基因型的BAM文件。

图 1 Fig. 1。图1展示了Locityper的核心原理:从参考面板中提取四个位点单倍型(A-D),将全基因组测序读段招募到这些单倍型上,然后通过优化读段比对、插入片段大小和读深分布,为每个可能的基因型计算联合似然。图中以基因型A,B为例,说明其因比对错误少且读深稳定而获得最高似然。
核心亮点
亮点 1|Locityper运行速度快,适用于大规模队列
Locityper对30× Illumina全基因组测序数据的预处理平均耗时16分钟(8线程),内存15Gb。对256个目标位点的读段招募、比对和基因分型共需约1小时19分钟。对MHC和KIR位点的完整分析(包括预处理)仅需35分钟,加权模式下为1小时5分钟。相比之下,T1K处理相同位点需要2小时30分钟(MHC)和48分钟(KIR)。Locityper的低运行时间和内存占用使其可扩展至生物样本库规模的队列。

图 2 Fig. 2。图2总结了Locityper在不同测序技术下的准确性。a-b定义了单倍型错误率和QV的对应关系。c-g展示了在LOO设置、单倍型可用性、1KGP变异集、Sniffles+DeepVariant、三体一致性和完整参考面板下的QV分布。Locityper在Illumina数据上中位QV=35.27,在HiFi数据上中位QV=36.90,显著优于现有流程。
补充图

图 3 Fig. 3。图3展示了在256个CMR位点上,预测单倍型按QV分箱的分布情况。大部分单倍型集中在高QV区间(≥33),表明Locityper在多数位点上实现了高精度预测。

图 4 Fig. 4。图4比较了Locityper与T1K在MHC和KIR位点的分型准确性。a显示在MHC位点的40个假基因上,Locityper的全匹配率(88.8%)显著高于T1K(64.1%);b显示在KIR基因簇的17个假基因上,Locityper同样优于T1K。加权模式进一步提升了Locityper的准确性。

图 5 Fig. 5。图5展示了Locityper在MUC、FCGR、CFH和CYP2基因家族上的分型改进。a-b为MUC1和MUC5B的基因模型,显示VNTR结构。c显示在15个MUC位点上,Locityper的平均QV比1KGP高10.5个点;d显示在FCGR2B、FCGR3A、CFH和CYP2基因上,Locityper也取得了显著提升。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 全基因组测序、泛基因组参考面板、整数线性规划、模拟退火、贝塔二项分布、负二项分布
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事复杂基因组区域分析、疾病关联研究或生物样本库数据处理的生信从业者和研究生。
带走一句
对于复杂多态基因的分型,放弃传统的变异检测思路,转而利用泛基因组参考面板中的单倍型序列进行靶向基因分型,可以大幅提高准确性,且适用于短读长和长读长数据。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。