周启涛生物技术工作室
基因组与遗传2024/09/04· 编译自 Nature

IF50.5|淀粉酶基因座结构多样性揭示农业革命驱动的近期正选择

人类淀粉酶基因座存在28种结构单倍型,重复型单倍型在近1.2万年间频率增加7倍。

人类淀粉酶基因座存在28种结构单倍型,重复型单倍型在近1.2万年间频率增加7倍。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

农业的兴起使人类饮食迅速转向富含淀粉的食物。淀粉酶基因负责淀粉消化,已有研究发现部分高淀粉摄入的现代人群携带更高的AMY1拷贝数,但缺乏近期选择的证据。该基因座包含三个淀粉酶基因(AMY1、AMY2A、AMY2B),在人类中表现出广泛的拷贝数变异,而其他大猿类仅有一个拷贝。由于该区域结构复杂、重复序列多,短读长测序难以解析其单倍型结构,导致此前无法准确评估其进化历史。

科学问题

卡在哪里: 此前研究受限于短读长测序,无法解析淀粉酶基因座复杂的结构变异,导致无法准确推断单倍型结构及其进化历史。同时,由于结构变异与邻近SNP的连锁不平衡模式复杂,传统的基于SNP的选择扫描方法难以检测到该位点的选择信号。

本文要回答: 本文旨在利用长读长组装和泛基因组图方法,全面解析淀粉酶基因座的结构多样性,重建其进化历史,并检验农业革命后该位点是否受到正选择。

技术路线

作者主要用了:长读长组装、MAP-graph、PGGB、单倍型解卷积、古DNA分析

作者首先利用94个长读长单倍型组装构建了淀粉酶基因座的泛基因组图,识别出28种结构单倍型。然后,通过分析侧翼SNP的连锁不平衡和构建溯祖树,揭示了这些结构单倍型的进化关系。接着,开发了单倍型解卷积方法,将短读长测序数据映射到泛基因组图上,推断个体的结构单倍型。最后,将该方法应用于533个古代基因组,追踪了过去1.2万年间单倍型频率的变化,并结合多种选择推断方法检验了正选择信号。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了全球147个人群中AMY1、AMY2A和AMY2B的平均拷贝数分布。AMY1拷贝数在大洋洲、东亚和南亚最高,AMY2A在非洲最高,AMY2B在中亚/西伯利亚、东亚和大洋洲几乎无重复。d图显示农业人群的三种淀粉酶基因拷贝数均高于渔猎和畜牧人群,其中AMY1差异最显著。

核心亮点

亮点 1|全球淀粉酶拷贝数多样性

通过对4292个现代人基因组进行拷贝数分析,发现AMY1拷贝数在2-20之间,AMY2A在0-6之间,AMY2B在2-7之间。农业人群的AMY1拷贝数显著高于渔猎和畜牧人群(P=0.0019),AMY2A和AMY2B也呈现类似趋势。此外,AMY2A和AMY2B拷贝数与胰腺表达水平显著正相关(P=4.4×10^-5和P=6.5×10^-4),表明拷贝数变异具有功能影响。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了淀粉酶基因座的结构多样性。a图显示AMY1、AMY2A和AMY2B拷贝数之间存在复杂关系。b图展示了MAP-graph和变异图的结构。c图展示了28种结构单倍型,按共识结构聚类,揭示了广泛的拷贝数组合和结构变异。

亮点 2|28种结构单倍型的鉴定

利用94个长读长单倍型组装构建泛基因组图,鉴定出28种独特的结构单倍型,其中仅2种此前已被完整测序。这些单倍型在结构上高度多样,AMY1拷贝数从1到9不等,AMY2A从0到3,AMY2B从1到3。通过主束分解和邻接树分析,发现这些结构可归类为11个共识结构,其中3个为新发现。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示了淀粉酶基因座侧翼SNP的连锁不平衡和进化历史。a图显示跨越结构变异区的SNP间存在极高的连锁不平衡,远高于染色体其他区域。c图的溯祖树显示大多数结构单倍型在不同分支上反复出现,表明反复演化。d图展示了各基因拷贝数的祖先状态重建,揭示了多次重复和删除事件。

亮点 3|结构单倍型的反复演化

通过构建侧翼SNP的溯祖树并进行祖先状态重建,发现大多数结构单倍型在不同单倍型背景上反复出现,表明该位点具有极高的结构变异突变率。AMY1的重复/缺失突变率约为2.09×10^-4/代,是SNP突变率的约10000倍。AMY2A和AMY2B的突变率较低,且AMY2B重复具有单一进化起源。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了单倍型解卷积方法的原理和全球单倍型频率。a图示意了将短读长测序数据映射到泛基因组图并推断结构单倍型的过程。b图展示了不同大陆人群中各共识结构的频率分布,显示明显的群体分层。c图显示农业人群富集高拷贝单倍型,而渔猎人群富集低拷贝单倍型。

亮点 4|单倍型解卷积揭示全球分布

开发了基于泛基因组图的单倍型解卷积方法,准确率约95%。应用该方法分析7188个单倍型,发现参考单倍型H3r全球最常见,但H5在东亚高频,H9在美洲、东亚和中亚出现。农业人群显著富集高拷贝单倍型(P=0.011),而渔猎人群富集低拷贝单倍型。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了西欧亚古代基因组中淀粉酶单倍型频率的变化。a图显示533个古代样本的地理分布和年代。b图显示过去1.2万年间三种淀粉酶基因的总拷贝数均显著增加。c图显示重复型单倍型频率从约0.12上升到0.86。d-f图展示了三种选择推断方法的结果,均支持正选择。

亮点 5|西欧亚人群的近期正选择

对533个古代基因组进行单倍型解卷积,发现过去1.2万年间,携带重复的淀粉酶单倍型频率从约0.12上升到0.86,增加超过7倍。三种选择推断方法均支持正选择,估计选择系数约为0.0175-0.06,选择开始于约9千年前,与农业传播时间吻合。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

长读长组装和泛基因组图方法能够解析复杂结构变异,为研究结构变异在进化中的作用提供了新范式。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。