周启涛生物技术工作室
基因组与遗传2025/04/23· 编译自 Nature

IF50.5|四代家系全基因组解析人类新发突变率

用五种测序技术拼出28人四代家系,首次看清重复区域的新发突变全貌。

用五种测序技术拼出28人四代家系,首次看清重复区域的新发突变全貌。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

人类新发突变(de novo mutation, DNM)是遗传病和进化的基础,但以往研究多依赖短读长测序,难以覆盖着丝粒、片段重复、Y染色体异染色质等高度重复区域。端粒到端粒(T2T)参考基因组虽然补齐了约8%的重复序列,但基于单一参考的变异检测仍存在参考偏差。CEPH 1463是一个被研究了三十年的多代家系,此前已有短读长测序的DNM数据,但重复区域的突变率仍不清楚。本研究利用五种互补的测序技术,对28名家庭成员进行全基因组测序和组装,旨在系统性地消除区域、变异类型和参考基因组带来的偏差,建立人类DNM的基准数据集。

科学问题

卡在哪里: 此前基于短读长测序的DNM研究通常报告每代约60-70个突变,但系统性地排除了基因组中最易突变的重复区域,如着丝粒、片段重复和Y染色体卫星DNA。此外,短读长难以区分生殖系突变与合子后突变,也无法准确解析串联重复的长度变化。

本文要回答: 构建一个高质量的四代家系参考资源,全面解析人类新发突变率,包括单核苷酸变异、插入缺失、串联重复和结构变异,并评估重复区域对突变率的贡献。

技术路线

作者主要用了:PacBio HiFi、ONT超长、Strand-seq、Illumina、Element AVITI

作者对CEPH 1463家系的28名成员进行了五种测序技术的全基因组测序,其中PacBio HiFi、Illumina和Element数据来自外周血DNA,ONT超长和Strand-seq数据来自淋巴母细胞系。利用Verkko和hifiasm两种算法构建了G1-G3的单倍型分型基因组组装,G4仅用HiFi组装。通过多平台数据交叉验证,结合家系传递信息,系统性地检测了SNV、indel、串联重复和结构变异的新发突变,并利用重组图谱和单倍型分析区分生殖系突变与合子后突变。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了CEPH 1463家系的28名成员及测序策略。G2-G4成员使用外周血DNA进行PacBio HiFi、Illumina和Element测序,G1-G3成员使用淋巴母细胞系进行ONT超长和Strand-seq测序。家系扩展到第四代和G3配偶,为跨代验证新发突变提供了基础。

核心亮点

亮点 1|每代平均152个新发突变

在排除合子后突变后,作者估计每代传递98-206个新发突变,平均152个,远高于短读长研究的60-70个。其中生殖系SNV约74.5个,非串联重复indel约7.4个,串联重复来源的indel或结构变异约65.3个,着丝粒DNM约4.4个。男性个体中,Y染色体每代约12.4个新发事件。这些数据首次将重复区域纳入全基因组突变率估计,揭示了突变负荷的真实规模。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2a显示G2和G3个体中生殖系新发突变、合子后突变和indel的数量,其中G3个体还展示了串联重复DNM。图2b显示生殖系SNV的平均等位基因平衡接近0.5,而合子后SNV的平均等位基因平衡低于0.25。图2c显示生殖系SNV有显著的父本年龄效应,而合子后SNV没有。图2d显示新发SNV在着丝粒和片段重复中显著富集。

亮点 2|串联重复是最易突变位点

作者利用TRGT对768万个串联重复位点进行基因分型,发现平均每个样本有65.3个串联重复新发突变,突变率为4.74×10^-6/位点/单倍型/代。短串联重复(STR)突变率(5.50×10^-6)高于可变数目串联重复(VNTR,0.83×10^-6)。二核苷酸基序突变率高于同聚物,且基序长度大于6 bp时突变率随基序增大而升高。75%的串联重复新发突变来自父本。此外,作者鉴定出32个跨代或同代复发的串联重复位点,其中16个位点观察到3次以上独立突变事件。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a展示了不同基序大小的串联重复突变率,二核苷酸基序突变率最高,基序大于6 bp时突变率随基序增大而升高。图3b显示75%的串联重复新发突变来自父本。图3c和3d展示了一个跨代复发的串联重复位点,该位点有10次独立的新发扩张或收缩事件。

亮点 3|着丝粒结构变异影响动粒位置

在288个完整组装的着丝粒中,作者评估了150次跨代传递,发现18个新发结构变异(12%),其中13个位于α-卫星高阶重复(HOR)阵列。这些变异均为HOR单元整数倍变化,大小从680 bp到12,228 bp不等。染色体6着丝粒具有最多几乎完全相同的HOR单元,也表现出最多的复发结构事件。通过CpG甲基化分析,作者发现位于CDR内的结构变异会导致CDR中心位置平均偏移约260 kb,提示着丝粒结构突变可能改变动粒附着位点。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4a总结了正确组装的着丝粒数量及跨代传递情况,其中18个着丝粒携带新发结构变异。图4b显示这些结构变异的大小分布。图4c展示了一个染色体6着丝粒α-卫星HOR阵列中的新发缺失,该缺失被传递给下一代。图4d-f展示了一个染色体9着丝粒的复杂结构变异,包括一次获得和一次丢失。图4g显示位于CDR内的结构变异导致CDR中心位置偏移。

亮点 4|Y染色体突变率高出常染色体一个数量级

利用G1祖父的Y染色体组装作为参考,作者在5名G2-G3男性中鉴定出48个新发SNV,平均每代9.6个,突变率为1.99×10^-7/碱基/代,比常染色体高一个数量级。其中45个SNV位于Yq12异染色质卫星区域,29%的突变与Yq12其他位置完全匹配,提示基因间转换(interlocus gene conversion)驱动了这种高突变率。此外还发现9个indel和5个结构变异,后者均影响整个DYZ2重复单元。82%的Y染色体DNM位于短读长无法可靠比对的区域。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5a展示了携带R1b1a-Z302 Y染色体的9名男性家系成员及Y染色体组装的两两比较。图5b总结了Y染色体新发突变,包括48个SNV、9个indel和5个结构变异,其中大多数位于Yq12异染色质区域。图5c和5d展示了一个新发SVA插入事件,该插入在父亲中为低频率嵌合体,但在祖父的单倍型中不存在,提示该事件起源于G2的合子后阶段。

亮点 5|16%的新发SNV为合子后起源

通过单倍型分析和等位基因平衡,作者将119个新发SNV归类为合子后突变(PZM),占常染色体新发SNV的16%。与生殖系突变不同,PZM没有父本偏倚(1.38:1),也没有亲本年龄效应。在四个有后代样本中,64.5%的PZM传递给了下一代,表明这些突变也存在于生殖细胞。PZM在片段重复中富集3.9倍,提示早期胚胎细胞分裂中的错误可能在这些区域更为频繁。

亮点 6|重组与结构变异无关联

作者构建了高分辨率重组图谱,在22次传递中鉴定出1,503个减数分裂断点,分辨率中位数约2.5 kb。父本重组显著偏向染色体末端,母本重组事件多于父本(1.4:1)。值得注意的是,27个常染色质新发结构变异均不与重组断点重叠,不支持同源染色体间非等位同源重组(NAHR)作为这些变异的主要机制。此外,作者观察到亲本年龄与重组断点数呈负相关,但这一现象需要更多家系验证。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: PacBio HiFi、ONT超长、Strand-seq、Illumina、Element AVITI
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事人类遗传变异、新发突变、基因组组装或重复区域分析的研究者。

带走一句

做DNM分析时,只用短读长会系统性低估突变率,尤其是重复区域;多平台长读长加家系传递验证是金标准。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。