周启涛生物技术工作室
基因组与遗传2025/01/08· 编译自 Nature Genetics

IF31.7|170个人类基因组揭示片段重复的结构多态性与多样性

长读长组装首次系统解析人类片段重复的群体结构变异,发现非洲人群携带更多新近重复。

长读长组装首次系统解析人类片段重复的群体结构变异,发现非洲人群携带更多新近重复。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

片段重复(SDs)是长度大于1 kb、序列一致性高于90%的同源DNA块,约占人类基因组的7%。它们通过非等位同源重组(NAHR)驱动拷贝数变异,贡献了人类个体间大部分碱基差异,并与免疫、神经、心血管疾病及人类进化密切相关。然而,由于SDs高度相似且重复,短读长测序难以准确组装和分型,导致这些区域在大多数基因组研究中被排除。近年来,PacBio HiFi长读长测序和组装算法的进步使得单倍型级别的SDs解析成为可能。

科学问题

卡在哪里: 此前对SDs的群体遗传学研究主要基于短读长深度估计拷贝数,无法提供重复序列的位置、结构及基因内容信息。此外,参考基因组不完整导致比对偏差,且缺乏对非洲人群等遗传多样性较高群体的系统比较。

本文要回答: 利用170个人类单倍型组装,全面解析SDs的群体结构变异,比较非洲与非非洲人群差异,并评估多态性SDs的基因表达潜力。

技术路线

作者主要用了:PacBio HiFi测序、hifiasm组装、SEDEF SD注释、fastCN拷贝数估计、Iso-Seq转录组分析

作者收集了来自HPRC和HGSVC的170个人类单倍型组装(85个样本,38个非洲裔,47个非非洲裔),统一使用hifiasm算法组装。首先用SEDEF识别SDs,并映射到T2T-CHM13参考基因组,区分已知和新发现的SDs。然后通过比较不同单倍型间的SD存在与否,估计等位基因频率,构建SDs的泛基因组图谱。同时利用Illumina短读长数据通过fastCN验证拷贝数,并用Iso-Seq长读长转录组数据评估多态性SDs的基因表达潜力。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了170个单倍型中染色体内SDs的单倍型频率分布。每条染色体旁的黑色条带代表T2T-CHM13中已知的SDs,彩色条带代表不同频率的多态性SDs。可以看出,某些染色体区域(如1q、8p、16p等)富集稀有SDs,而近端着丝粒染色体短臂因组装困难被排除。

核心亮点

亮点 1|染色体内SDs多态性更高

在170个单倍型中,共鉴定出173.2 Mb的SD序列,其中47.4 Mb是T2T-CHM13参考基因组中不存在的新序列。染色体内SDs中59.7%是可变的,而染色体间SDs中78.4%是固定的。新发现的SDs倾向于定位在已知SDs附近,且随着样本量增加,SDs累积呈渐近趋势,非洲样本贡献更多新SDs。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2显示了随着基因组数量增加,SDs的累积曲线。固定SDs(所有样本共有)很快达到平台期,而多态性SDs(已知和新发现)持续增加,尤其是非洲样本贡献更多新SDs。这表明非洲人群具有更高的SD多样性。

亮点 2|稀有SDs更长且序列一致性更高

稀有SDs(等位基因频率<3%)比常见SDs(3-10%)更长且序列一致性更高,提示其起源更近。然而,也存在低频但高度分化的SDs,可能代表正在丢失的古老重复。此外,低频SDs更倾向于远离已知SDs,表明散布过程在人类群体中仍在进行。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a比较了稀有和常见SDs的长度与序列一致性。稀有SDs整体更长且一致性更高,但存在一些低频但高度分化的SDs。图3b显示多态性SDs中散布型(>1 Mb)比例高于单例SDs,且散布型多态性SDs更倾向于反向重复。

亮点 3|非洲人群携带更多染色体内SDs

非洲裔基因组中的染色体内SDs含量显著高于非非洲裔(Mann-Whitney U检验,P=1.6×10^-6)。在90个可变拷贝数的基因家族中,17个在非洲和非非洲样本间存在拷贝数分布差异,其中16个在更大的短读长队列(n=2,196)中得到验证,且13个(81%)在非洲样本中拷贝数更高。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了几个新发现的SDs结构示例。a显示chr5上一个65.8 kb的反向成簇重复;b-d显示chr9、chr13和chr1上的串联重复;e和f显示chr12上的散布重复,其中一个98.9 kb的重复在34个单倍型中出现,另一个2.5 kb的重复在8个单倍型中出现。

亮点 4|多态性SDs编码201个新蛋白基因

利用563百万条全长Iso-Seq reads,作者在170个单倍型中预测出260个新的蛋白编码基因,其中201个位于SDs区域。这些基因富集于免疫相关通路,如白细胞介导的免疫调节、抗原加工呈递等。20个新基因属于免疫球蛋白超家族,10个位于核心duplicons中。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5a和b展示了拷贝数变异最大和最小的基因家族。高变异家族如GOLGA6/8、NBPF等拷贝数在10-50之间波动,而低变异家族如HYDIN、RGPD3等拷贝数稳定。图5c显示了GOLGA6/8各旁系同源基因在不同单倍型中的拷贝数,大多数旁系同源基因存在缺失或拷贝数变异,但GOLGA6L2、GOLGA8M等5个基因在所有单倍型中均为单拷贝。

亮点 5|ZNF972:一个在部分人类中存在的古老重复基因

作者发现了一个新的KRAB锌指蛋白基因ZNF972,其与已知基因ZNF98仅有69%一致性。该基因位于chr19p12的ZNF簇内,在35.9%的人类单倍型中存在,但在GRCh38和T2T-CHM13参考基因组中缺失。该区域在猩猩、大猩猩和红毛猩猩基因组中存在,但只有大猩猩中保留了完整的开放阅读框,表明ZNF972是一个古老的重复基因,在部分人类中保留,在其他猿类中假基因化。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

长读长组装是解析高重复区域群体变异的必要手段,SDs的泛基因组图谱为疾病关联和进化研究提供了新资源。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。