IF31.7|结构化溯祖模型揭示现代人共享的深层祖先结构
现代人源自约150万年前分化的两个祖先群体,约30万年前以80:20比例混合。
现代人源自约150万年前分化的两个祖先群体,约30万年前以80:20比例混合。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
人类演化遗传学的核心问题之一是理解历史上的群体混合事件和有效群体大小变化。PSMC等基于溯祖的模型被广泛用于推断群体大小历史,但其假设群体一直随机交配(panmixia),忽略了可能存在的群体结构。已有大量证据表明,晚更新世和全新世人类群体反复分离和混合,且尼安德特人、丹尼索瓦人等古人类与现代人之间存在基因交流。理论分析指出,任何具有群体大小变化的随机交配模型,都存在一个具有相同成对溯祖率谱的群体结构模型,因此仅凭溯祖率无法区分二者。
科学问题
卡在哪里: PSMC假设群体无结构,但实际人类历史中结构普遍存在。仅凭成对溯祖率无法区分结构模型与随机交配模型,导致群体大小推断可能被误导。此前方法未能利用相邻溯祖时间的条件分布信息来识别深层祖先结构。
本文要回答: 开发一个能显式建模祖先群体分裂和再混合的溯祖隐马尔可夫模型,并利用其区分结构模型与随机交配模型,进而推断现代人历史中的深层结构事件。
技术路线
作者主要用了:溯祖隐马尔可夫模型(cobraa)、PSMC、后验解码、B-map、GO分析。
作者构建了一个脉冲式群体结构模型:祖先群体在T2时刻分裂为A和B两个群体,在T1时刻以比例γ混合,之后A群体大小可随时间变化,B群体大小恒定。基于SMC框架,将重组过程划分为十种互斥情形,推导出转移矩阵,并实现为HMM(cobraa)。通过模拟数据验证模型识别力和参数估计准确性,然后应用于人类1000GP和HGDP数据,并扩展为cobraa-path以推断基因组区域来源。

图 1 Fig. 1。图1展示模型示意图和SMC扩展。a部分显示祖先群体在T2分裂为A和B,在T1混合。b部分展示SMC中十种互斥情形,说明重组如何改变溯祖时间。该图帮助理解cobraa的模型结构和转移矩阵推导。
核心亮点
亮点 1|结构模型优于随机交配模型
对1000GP的26个群体各取一个高深度个体,运行cobraa和PSMC。cobraa推断出约150万年前群体分裂,约29万年前混合,混合比例约80:20。所有群体的对数似然差ΔL均为正值,表明结构模型显著优于随机交配模型。在HGDP数据中也得到类似结果,包括San群体。模拟显示,结构模型产生的PSMC推断与真实人类PSMC结果相似,说明结构模型与以往基于随机交配假设的推断兼容。

图 2 Fig. 2。图2展示结构模型与非结构模型具有相同溯祖率谱但转移矩阵不同。蓝色线为结构模型的理论溯祖率,橙色线为匹配的非结构模型。ξ=(QU-QS)/QS 的热图显示相对差异非零,且随混合比例或分离时间增加而增大,表明转移矩阵包含区分信息。
亮点 2|A群体在分裂后经历强烈瓶颈
cobraa推断在约150万年前分裂后,主要祖先群体A立即经历强烈瓶颈,随后有效群体大小逐渐增加直至混合。平均而言,群体B的大小远大于A。通过约束模型(如强制A群体大小恒定)发现,缺乏瓶颈的模型拟合显著变差,表明瓶颈是解释数据所必需的。这一瓶颈可能对应一次奠基者事件,与迁移或地理隔离有关。

图 3 Fig. 3。图3展示模拟数据上的参数推断能力。a部分显示混合比例γ的估计,在γ≥5%时恢复良好,但高γ时低估。b和c部分比较PSMC和cobraa对模拟结构数据的推断,PSMC产生假峰,而cobraa更接近真实值。d和e部分显示分裂和混合时间的似然面,最大似然接近模拟值。f部分显示结构模型与随机交配模型的似然差,结构模拟数据下ΔL为正。
亮点 3|少数群体B的遗传物质受到负选择
利用cobraa-path推断基因组区域来源,发现来自少数群体B的区域与距离编码序列的距离(dcCDS)呈正相关(Spearman ρ≈0.075-0.078),与B-map(背景选择强度)的相关性更强(ρ≈0.228-0.301),表明B来源的遗传物质在现代人中受到负选择。进一步分析发现,混合丰富基因(AAGs)富集于神经元细胞粘附、惊跳反应、神经递质运输等神经相关通路,而混合稀缺基因(ASGs)富集于pre-miRNA加工、肌动蛋白细胞骨架组织等过程,并显著缺失于嗅觉感知和抗菌体液免疫等通路。

图 4 Fig. 4。图4展示人类数据推断结果。a部分为PSMC推断的群体大小,b部分为cobraa推断的A群体大小,显示分裂后瓶颈。c部分显示每个群体的ΔL均为正,且混合比例约0.2。cobraa推断的分裂时间约1.5 Ma,混合时间约290 ka。
亮点 4|主要群体A是尼安德特人和丹尼索瓦人的祖先来源
在非洲个体中,人类-尼安德特人和人类-丹尼索瓦人的序列分歧与区域被推断为A来源的概率呈显著负相关(Spearman ρ≈-0.4至-0.53,P<1×10^-10)。A来源区域的平均分歧约0.0012,而B来源区域约0.0028,表明尼安德特人和丹尼索瓦人更可能源自主要群体A,而非少数群体B。这一结果独立于古人类基因组数据,支持结构模型的真实性。

图 5 Fig. 5。图5展示人类-古人类分歧与A来源概率的关系。a和b部分分别显示与尼安德特人和丹尼索瓦人的分歧,随A来源概率增加而降低,线性拟合线斜率为负,表明A群体是古人类的祖先来源。
亮点 5|cobraa在其他物种中推断出不同历史
对蝙蝠、海豚、大猩猩和黑猩猩应用cobraa。蝙蝠未显示结构证据;海豚推断出约65万年前分裂、10万年前混合,混合比例0.22;东部低地大猩猩推断出约15万年前分裂、1.5万年前混合,混合比例0.29,与已知东部和西部大猩猩分化时间一致;尼日利亚-喀麦隆黑猩猩推断出非常近期的结构,但参数处于边界,可能反映持续的基因流。这些结果表明cobraa能根据不同物种的基因组历史做出不同推断。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 溯祖隐马尔可夫模型(cobraa)、PSMC、后验解码、B-map、GO分析
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事群体遗传学、人类演化或溯祖模型开发的研究者。
带走一句
仅用单个二倍体基因组,通过建模祖先结构并利用转移矩阵信息,可以区分结构模型与随机交配模型,揭示深层混合事件。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。