IF50.5|古DNA揭示西欧亚大陆近万年广泛定向选择
近万年来数百个等位基因受强定向选择,多基因性状发生显著变化。
近万年来数百个等位基因受强定向选择,多基因性状发生显著变化。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
古DNA研究已彻底改变我们对人群历史的认识,但其在揭示人类进化生物学方面的潜力尚未充分实现。此前基于古DNA的选择扫描受限于样本量小,且难以区分由自然选择驱动的等位基因频率持续上升(定向选择)与由迁徙、群体结构或非适应性纯化/稳定选择导致的频率变化。经典硬扫掠在人类进化长河中较为罕见,但全新世以来西欧亚大陆人群经历了剧烈的文化与生活方式变迁,可能伴随新的选择压力。已有研究在古DNA时间序列中检测到数十个受选择位点,但单个研究中达到全基因组显著水平的位点数量增长缓慢,从2015年的12个仅增至2024年的21个,提示方法学瓶颈限制了发现。
科学问题
卡在哪里: 此前古DNA选择扫描面临两大挑战:一是群体混合和遗传漂变造成的背景噪声远大于选择信号,传统基于混合比例建模的方法功效不足;二是样本量有限,且缺乏有效校准全基因组显著性阈值的手段,导致假阳性控制困难。此外,多基因选择(作用于复杂性状的众多微效等位基因)在古DNA数据中尚未得到系统评估。
本文要回答: 开发一种在古DNA时间序列中检测定向选择的新方法,并将其应用于大规模西欧亚人群样本,系统揭示全新世以来单变异和多基因层面的选择信号。
技术路线
作者主要用了:GLMM、PGS、LDSC、SLiM模拟、HAF。
作者构建了一个广义线性混合模型(GLMM),以个体间遗传关系矩阵(GRM)为协方差结构,同时拟合时间趋势项(选择系数s)和群体结构随机效应,从而在控制复杂群体历史的条件下检验等位基因频率是否随时间发生一致性变化。为校准显著性阈值,作者利用UK Biobank GWAS信号富集模式确定经验阈值,并通过正向模拟验证方法的稳健性。随后,作者将该方法应用于15,836个古DNA样本(其中10,016个为新数据),对9.7百万个变异进行全基因组扫描,并进一步采用多基因评分(PGS)和LDSC等方法检测多基因选择。

图 1 Figure 1:。图1展示了GWAS信号富集与选择统计量X的关系,用于校准显著性阈值。a图显示随|X|增大,UK Biobank GWAS显著SNP的富集倍数上升并在约5.2倍处达到平台,提示该处为真实信号与假阳性的分界。b图通过模拟验证富集模式与1-FDR曲线吻合。c图显示残差HAF分数随|X|增加而上升,支持定向选择信号。d图模拟确认该模式仅由定向选择产生。e图显示选择信号在血液-免疫-炎症性状中显著富集,而在精神-神经-行为性状中无富集。
核心亮点
亮点 1|479个独立位点受强定向选择
以|X|>5.45为阈值(对应后验概率π>99%),作者鉴定出479个独立位点(排除HLA区域后为410个)显示强烈的定向选择信号。这些位点的选择系数中位数为0.86%(范围0.43-4.3%),次要等位基因频率中位数为13%。在更宽松的阈值(|X|>3.61,FDR=50%)下,非HLA位点数量达到7,689个,暗示超过3,800次独立选择事件。这些信号广泛分布于基因组,与大多数变异处于连锁不平衡状态。

图 2 Figure 2:。图2展示了全基因组选择扫描结果。a图为曼哈顿图,显示多个位点超过|X|=5.45的显著性阈值。b图显示估计的选择系数与次要等位基因频率的关系,叠加了模拟的检测功效网格,表明常见变异的选择系数估计更精确。c图比较了受选择等位基因的估计年龄与基于恒定选择系数的预期扫掠年龄,显示许多等位基因年龄远大于预期,暗示选择系数随时间变化。
亮点 2|选择信号富集于免疫与代谢性状
通过分层LD评分回归(S-LDSC),作者发现受选择位点显著富集于影响血液-免疫-炎症性状的变异(95% CI 3.12-8.24),而对精神-神经-行为性状无显著富集。进一步分析显示,血液-免疫-炎症和心血管代谢性状的选择强度在青铜时代相对于前农业时期显著增加,可能反映了对新饮食、更大群体规模或与家养动物密切接触的适应。

图 3 Figure 3:。图3展示了36个具有代表性的单变异等位基因频率轨迹,每个面板包含选择系数、选择统计量和后验概率。轨迹显示不同位点的频率变化模式各异,有的持续上升,有的先升后降,有的无明显变化。这些轨迹结合了来自西欧狩猎采集者、早期欧洲农民和草原牧民的频率数据,揭示了选择压力的时空动态。
亮点 3|多基因选择改变复杂性状
在563个GWAS中,44个在所有三种多基因选择测试(γ、γsign、rs)中均达到显著水平。作者重点展示了12个性状,包括浅肤色多基因评分显著上升(χ=1.80±0.10,P=5.7×10⁻⁷⁴),体脂百分比、腰围等2型糖尿病风险相关性状的多基因评分显著下降,精神分裂症和双相情感障碍风险等位基因频率降低,以及智力测试分数、家庭收入和受教育年限相关多基因评分上升。这些信号高度多基因化,需剔除数百个位点后才消失。

图 4 Figure 4:。图4展示了12个多基因选择信号的实例,每个面板显示多基因评分随时间的变化(黑色实线)及其95%置信区间(灰色阴影)。红色表示校正群体结构后的线性混合模型回归斜率γ。圆圈代表三个古代人群的多基因评分均值。所有展示的性状在三种多基因选择测试中均显著,表明这些复杂性状受到了协调的定向选择。
亮点 4|选择系数随时间波动
通过滑动2000年窗口重新估计选择系数,作者发现许多位点的选择压力并非恒定。例如,HLA-DRB1、TYK2和HFE等位点在不同时期表现出选择方向的逆转。通过比较突变年龄与基于恒定选择系数推算的扫掠时间,作者估计约三分之一的受选择等位基因其真实年龄比预期扫掠年龄老一个数量级,表明选择系数随时间变化。这解释了为何在更长时间尺度上未观察到大量固定差异。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: GLMM、PGS、LDSC、SLiM模拟、HAF
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事群体遗传学、古DNA分析或复杂性状进化研究的科研人员。
带走一句
古DNA时间序列结合混合模型可有效分离定向选择与群体结构,为多基因选择检测提供了新范式。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。