IF50.5|长读长测序解析1019人多祖先结构变异全景
基于ONT长读长测序,构建千人规模结构变异图谱,揭示转导与断裂点同源机制。
基于ONT长读长测序,构建千人规模结构变异图谱,揭示转导与断裂点同源机制。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
结构变异(SV)贡献了人类基因组中大部分多态性碱基,并与多种常见及罕见疾病密切相关。此前基于短读长测序的人群规模研究受限于读长,对插入、串联重复等复杂变异检测能力不足。长读长测序技术虽已用于疾病研究和诊断,但缺乏具有全球代表性的人群规模数据集。人类泛基因组参考联盟(HPRC)已发布基于44个二倍体基因组的草图泛基因组,展示了图参考在SV发现中的优势,但样本量有限,难以覆盖稀有和祖先特异性变异。
科学问题
卡在哪里: 现有长读长SV资源样本量小、祖先代表性不足,且缺乏统一的图感知发现与基因分型框架,导致稀有变异和复杂位点(如多等位VNTR、倒位)的解析仍不充分。
本文要回答: 利用ONT长读长测序对1019名来自26个群体的个体进行中等深度测序,构建序列解析的SV图谱,并解析SV的群体分布、形成机制及转导特征。
技术路线
作者主要用了:ONT长读长测序、线性与图基因组比对、SAGA框架、SVAN注释、vamos VNTR基因分型。
作者选取1000基因组计划(1kGP)中1019个样本,进行ONT长读长测序(中位覆盖度16.9×,N50读长20.3 kb)。开发SAGA框架:先比对到GRCh38、CHM13线性参考和HPRC_mg图参考,用Sniffles、DELLY和SVarp发现SV,再将新SV等位序列通过伪单倍型构建和图增强整合进泛基因组图,最后用Giggles进行图感知基因分型,并用SHAPEIT5进行统计相位。该流程兼顾线性参考的成熟工具与图参考的多样性,实现大规模SV的准确发现与分型。

图 1 Fig. 1。图1展示样本组成、测序指标和SAGA框架。a显示1019个样本来自5大洲26个群体;b显示中位覆盖度16.9×和N50读长20.3 kb;c示意SAGA流程:线性/图比对、SV发现、图增强和基因分型。该图概括了研究设计和核心方法。
核心亮点
亮点 1|SV图谱规模与多样性
SAGA框架在967个样本中基因分型167,291个初级SV位点,相位后得到164,571个SV,包括65,075个缺失、74,125个插入和25,371个复杂位点。与短读长测序相比,插入位点数量增加超过10倍,缺失位点核苷酸解析数量增加40%。非洲裔样本中位SV数(23,969)显著高于非非洲裔(19,297),且稀有变异(MAF<1%)占59.3%,多数仅见于单一大陆群体。

图 2 Fig. 2。图2展示SV累积曲线、长度分布和群体特征。a显示随样本增加,SV发现趋于饱和,非洲样本贡献更大;b显示与短读长相比,插入检测显著提升,缺失在短读长中更多;c-f显示等位频率谱、功能区域SV频率降低及群体分化。
亮点 2|SV类别精细解析
SVAN注释工具将72,346个插入(96.0%)分类,包括17,029个重复、34,006个VNTR、31,302个非参考MEI(23,212 Alu、4,851 L1、3,239 SVA)、203个加工假基因和180个NUMT。此外,通过专门流程发现1,849个倒位,包括311个倒位重复和1,047个L1 5'端倒位。vamos基因分型进一步揭示369,685个多等位VNTR,远超图分析结果。

图 3 Fig. 3。图3展示SVAN分类结果。a按SV类别(VNTR、重复、MEI等)展示插入和缺失的数量、大小分布及等位频率;b展示倒位的亚类,包括倒位重复、平衡倒位和复杂倒位,并标注其形成机制。
亮点 3|L1与SVA转导的家族和位点特异性
在5,311个L1和3,470个SVA插入中,分别有466个(8.8%)和412个(11.9%)携带转导序列。L1转导以3'为主(82.2%),而SVA产生5'和3'转导比例相近。通过转导序列溯源,发现20个高活性L1源元件贡献了43.9%的L1转导,20个SVA源元件贡献36.9%的SVA转导。8q21.11位点的L1源元件表现出显著的5'转导偏好(Padj=3.9×10^-15),机制上与该位点上游启动子劫持导致异常剪接有关。

图 4 Fig. 4。图4展示L1和SVA转导的源元件活性。a和b分别列出20个最活跃的L1和SVA源元件,显示其参考基因组存在状态、亚家族和转导方向偏好;c-e以8q21.11为例展示5'转导的剪接机制。
亮点 4|断裂点同源谱与形成机制
对66,198个缺失和75,238个插入的断裂点分析显示,35.0%的缺失和28.7%的插入具有超过50 bp的同源侧翼,提示同源定向修复(HDR)参与。Alu介导的缺失(n=3,260)远多于插入(n=80),且89.3%的Alu侧翼对为全长Alu,同源长度峰值295 bp。此外,发现59个片段重复介导的缺失,同源长度可达14.9 kb。在无同源的缺失中,83.1%具有1-15 bp微同源,提示NHEJ或MMBIR等机制。

图 5 Fig. 5。图5展示断裂点同源分析。a示意断裂点分析策略;b显示SV长度与同源长度的关系,突出Alu、L1等重复介导的SV;c-f展示不同重复类型介导的SV分布;g展示12p13.3复发缺失的单倍型聚类证据。
亮点 5|TEMR介导的复发缺失
通过筛选200-9,000 bp同源侧翼、等位频率40-60%的缺失,并结合单倍型聚类和复发指示SNP分析,鉴定出6个具有强复发证据的缺失,均为转座元件介导的重排(TEMR)。例如,12p13.3处一个806 bp缺失由AluSx-AluY对介导,在非洲和南亚单倍型背景中独立出现,表明该位点发生了局部复发事件。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: ONT长读长测序、线性与图基因组比对、SAGA框架、SVAN注释、vamos VNTR基因分型
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事人类基因组变异、群体遗传学或罕见病诊断的生信分析人员。
带走一句
中等深度长读长测序结合图基因组方法,可高效构建人群规模SV资源,为变异过滤和机制研究提供模板。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。