周启涛生物技术工作室
基因组与遗传2025/10/08· 编译自 Nature

IF50.5|群体规模体细胞突变与选择图谱

单分子级超深测序揭示口腔上皮46个正选择基因与6.2万个驱动突变。

单分子级超深测序揭示口腔上皮46个正选择基因与6.2万个驱动突变。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

随着年龄增长,人体许多组织会被携带体细胞驱动突变的微小克隆定植。这些克隆是癌症发生的第一步,也可能参与衰老和其他疾病。然而,由于检测小克隆中突变的难度很大,此前研究局限于少数组织和较小队列。激光显微切割或单细胞培养等方法通量低,限制了人们对体细胞突变景观的全面理解。双链测序等纠错测序技术虽能降低错误率,但传统方案在文库制备过程中仍存在链间错误转移,导致错误率偏高。NanoSeq通过限制性内切酶片段化和双脱氧核苷酸阻断切口延伸,将错误率降至十亿分之五以下,但仅能覆盖部分基因组。

科学问题

卡在哪里: 现有NanoSeq方案依赖限制性内切酶,无法实现全基因组覆盖,且不兼容外显子组或靶向捕获,限制了其在驱动基因发现中的应用。此外,此前对正常组织体细胞突变的研究多局限于少数个体,缺乏群体规模的数据,难以系统评估突变率、突变特征和选择压力在人群中的变异及其与暴露因素的关系。

本文要回答: 开发兼容全基因组、全外显子和靶向捕获的超低错误率NanoSeq新方案,并在群体规模上系统描绘口腔上皮和血液的体细胞突变景观、选择压力和突变流行病学特征。

技术路线

作者主要用了:NanoSeq、双链测序、靶向捕获、dNdScv、突变特征分析、混合效应回归

作者首先优化了NanoSeq的片段化方法,引入超声打断加外切酶平滑和酶切打断两种新方案,在保持超低错误率的同时实现全基因组覆盖。随后,将新方案与靶向捕获结合,对1,042份口腔上皮拭子样本和371份血液样本进行深度测序,平均双链覆盖度分别达到665×和676×。利用dNdScv等工具检测正选择和负选择基因,并通过突变特征分解和混合效应回归模型,系统分析年龄、吸烟、饮酒等暴露因素对突变率和选择压力的影响。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了不同片段化和文库制备方案下脐带血粒细胞的基因组SNV负荷估计。四种方案中,两种新NanoSeq方案(超声和酶切)的突变负荷与既往限制性酶切NanoSeq结果一致,而标准双链测序方案错误率明显更高。图b显示单细胞来源脐带血的三核苷酸突变谱,验证了新方案的准确性。

核心亮点

亮点 1|新NanoSeq实现全基因组超低错误率

作者开发了两种新的片段化方法:超声打断加外切酶平滑(MB-NanoSeq)和酶切打断(US-NanoSeq),在保持原NanoSeq超低错误率(低于5×10⁻⁹)的同时,实现了全基因组覆盖。在脐带血DNA阴性对照中,两种新方案均得到与既往一致的突变负荷和突变谱。在福尔马林固定石蜡包埋(FFPE)等高损伤样本中,标准双链测序错误率升高约十倍,而新NanoSeq方案仍保持稳定,显示了其在处理受损DNA来源方面的潜力。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2a,b显示口腔上皮中SNV和indel负荷随年龄线性增加,斜率分别为18.0和2.0个突变/细胞/年。图c-f展示前20个显著驱动基因的突变计数、dN/dS比值和驱动突变频率。图g,h显示负选择基因的dN/dS比值,必需基因的截短突变dN/dS显著低于1。图i展示位点水平dN/dS鉴定的正选择位点数量。

亮点 2|口腔上皮46个正选择基因

对1,042份口腔上皮样本的靶向NanoSeq分析发现,突变随年龄线性累积,速率约为每年18.0个单核苷酸变异和2.0个插入缺失。通过dNdScv检测到46个基因在正常口腔上皮中受到正选择,共发现超过9万个非同义突变,其中约6.2万个为驱动突变。常见驱动基因包括NOTCH1、TP53、PPM1D等,与皮肤和食管中的发现一致,但还发现了31个此前未在皮肤或食管中报道的驱动基因,其中一些是头颈鳞癌的已知驱动基因。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a显示TP53的突变分布,本研究中的突变谱与COSMIC数据库中鳞癌的突变谱高度相似。图b比较了本研究中各基因的突变数量与COSMIC数据库,显示本研究在多个基因中发现的突变数量远超癌症研究。图c-e展示其他基因的突变分布和选择模式,如NOTCH1的EGF重复区聚集、RAC1的激活热点等。

亮点 3|必需基因的负选择证据

利用极高的双链覆盖度和新的单侧负选择检验,作者在9个基因中检测到显著的负选择,主要表现为对截短突变的清除。其中SF3B1、CHD4和CDK4是CRISPR筛选确定的必需基因。PIK3CA、SF3B1和TERT同时表现出对截短突变的负选择和对激活热点突变的正选择,提示这些基因在野生型细胞中为必需基因,但在获得激活突变后成为驱动基因。聚合17个已知必需基因的突变显示,截短突变的dN/dS为0.69,显著低于中性预期。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4a显示口腔上皮中NOTCH1、TP53和CHEK2突变克隆比例随年龄的变化,以及血液中DNMT3A和TET2的变化。口腔上皮中克隆比例随年龄线性增加,而血液中呈指数增长。图b展示推断的突变特征A和B,以及重度吸烟饮酒者和非吸烟非饮酒者的突变谱。图c,d显示特征A和B随年龄和饮酒量的变化。

亮点 4|体内饱和突变图谱

高深度测序产生了大量突变,使得构建基因内高分辨率选择图谱成为可能。例如,TP53的突变分布与COSMIC数据库中数千例癌症的突变谱高度相似,且本研究在TP53中发现的突变数量几乎相当于44,000个癌症外显子组和基因组的总和。通过位点水平dN/dS模型,作者鉴定出1,220个显著正选择的氨基酸位点,其中599个位于NOTCH1,268个位于TP53。这些数据为变异功能注释提供了体内饱和突变信息,有助于区分致病性和良性变异。

亮点 5|吸烟与饮酒的突变流行病学

突变特征分解鉴定出两个主要特征:特征A(类似SBS5/SBS1)和特征B(类似SBS16)。特征A随年龄线性累积,而特征B在重度饮酒者中显著升高。多变量混合效应回归显示,吸烟与总SNV、特征A和特征B以及驱动突变密度显著相关;饮酒与SNV和特征B相关,但与特征A无关。进一步分析提示,吸烟可能通过加剧酒精的致突变效应来增加特征B,而口腔卫生不良与特征A和驱动突变密度相关。这些结果揭示了主要口腔癌风险因素在早期致癌过程中的作用模式。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: NanoSeq、双链测序、靶向捕获、dNdScv、突变特征分析、混合效应回归
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事体细胞突变、癌症基因组学和流行病学研究的科研人员。

带走一句

单分子级超深测序可在群体规模上系统描绘正常组织的体细胞突变景观,为癌症早期发生和预防研究提供新工具。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。