周启涛生物技术工作室
基因组与遗传2025/04/16· 编译自 Nature

IF50.5|四倍体欧洲马铃薯分相泛基因组

10个历史品种揭示欧洲马铃薯85%的遗传变异,单倍型多样性极低但序列差异极高。

10个历史品种揭示欧洲马铃薯85%的遗传变异,单倍型多样性极低但序列差异极高。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

马铃薯是全球最重要的非谷物粮食作物,但其同源四倍体基因组高度杂合,严重阻碍了育种和基因组研究。此前仅有三份完整的分相基因组,且均需构建重组后代群体才能完成组装。这些基因组显示核苷酸多样性极高(约每50 bp一个差异),是人类基因组的20倍。欧洲马铃薯起源于安第斯山脉,约1570年引入欧洲,经历晚疫病大流行和现代育种瓶颈,其遗传多样性受到强烈影响。然而,高序列多样性与瓶颈效应之间的矛盾尚未厘清。

科学问题

卡在哪里: 已有分相基因组数量极少,无法代表欧洲马铃薯基因库的整体变异;且分相组装依赖长读长和重组群体,成本高、通量低。此外,欧洲马铃薯的单倍型多样性、野生种渐渗程度以及泛基因组规模均缺乏系统评估。

本文要回答: 构建欧洲马铃薯的分相泛基因组,解析其单倍型多样性和野生种渐渗历史,并开发基于短读长的单倍型分相方法。

技术路线

作者主要用了:PacBio HiFi、Omni-C、hifiasm、Hi-C scaffolding、SyRI、D-statistics、minigraph、haplotype graph

作者从Wageningen马铃薯谱系数据库筛选19世纪或现代育种奠基品种,经低深度测序和PCA选出10个最具多样性的品种。对每个品种进行PacBio HiFi长读长测序(86-113 Gb)和Omni-C染色质构象捕获测序,开发了整合Hi-C数据的四倍体分相组装流程tetraDecoder,获得40条单倍型染色体级组装。随后利用SyRI进行全基因组比对,分析结构变异和序列多样性;结合20个野生马铃薯基因组进行系统发育和D统计量分析以检测渐渗;利用minigraph构建泛基因组图并拟合曲线估计泛基因组大小;最后将泛基因组转化为单倍型图,用短读长k-mer匹配重建现代品种的单倍型。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了欧洲马铃薯的历史背景和泛基因组构建流程。a部分时间线显示马铃薯约1万年前在南美洲驯化,1570年引入欧洲,19世纪中叶晚疫病导致爱尔兰饥荒,1880年左右现代育种开始。b部分PCA图显示从19个候选品种中选出10个最具多样性的品种用于泛基因组构建。c部分展示分相组装流程:HiFi长读长初始组装,整合Hi-C数据分相,最终获得40条染色体级单倍型。d部分显示每条染色体的4条单倍型支架,表明成功分离了同源染色体。

核心亮点

亮点 1|单倍型多样性极低

尽管序列多样性极高(π=0.018,平均每56 bp一个变异位点),但单倍型多样性出乎意料地低。在10 kb窗口中,平均仅观察到9种不同的单倍型(理论最大值为40)。单倍型共享块可长达数十Mb,平均18%的单倍型对完全共享,最高达92%。全基因组连锁不平衡衰减缓慢(半衰期1.1-5.3 Mb),与低单倍型多样性一致。这表明欧洲马铃薯基因组由少数高度分化的单倍型组成,反映了驯化和引入欧洲过程中的强烈瓶颈效应。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了40条单倍型之间的序列和单倍型多样性。a部分显示染色体间成对比对,揭示大量倒位、重复和易位,最长倒位达37 Mb,主要位于着丝粒周围区域。b部分显示变异位点密度,平均每16 bp一个变异位点。c部分显示成对核苷酸多样性π=0.018(平均每56 bp一个变异)。d部分显示10 kb窗口内单倍型数量分布,平均仅9种。e部分显示单倍型共享块长度,部分区域共享块长达数十Mb。f部分显示全基因组连锁不平衡衰减,半衰期1.1-5.3 Mb,表明单倍型多样性极低。

亮点 2|野生种渐渗贡献高序列多样性

通过D统计量和f4统计量检测到来自野生马铃薯C4S分支的广泛渐渗,覆盖欧洲马铃薯单倍型基因组的约40%。渐渗区域与高序列多样性区域显著重叠(ANOVA F(1,725)=69.09, P=4.6×10⁻¹⁶, adjusted R²=0.31),而低多样性区域渐渗减少。系统发育和admixture分析显示欧洲品种具有混合祖先,尤其与C4S分支共享成分。这些渐渗发生在现代育种之前,可能源于南美洲驯化期间的人类迁移和植物运输。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示了野生种渐渗分析。a部分系统发育树显示野生马铃薯分为C1+2、C3和C4(C4S和C4N)分支,欧洲栽培品种单倍型位置分散。b部分admixture分析显示欧洲品种具有混合祖先,尤其与C4S分支共享成分。c-e部分D统计量结果显示C4S分支向欧洲品种的广泛渐渗,覆盖约40%基因组。f部分显示渐渗区域与高序列多样性区域重叠,证明渐渗是序列多样性的主要来源。

亮点 3|泛基因组已捕获85%变异

通过拟合泛基因组增长曲线,估计欧洲马铃薯完整泛基因组大小为1.75 Gb。当前40条单倍型(约1.5 Gb)覆盖约85%的变异,仅需再测序24个基因组即可达到95%覆盖。基因家族水平的泛基因组已饱和,表明40条单倍型包含了欧洲基因库中所有基因家族的代表。然而,核心基因组(所有单倍型共享的基因家族)持续下降,单个单倍型平均仅含90.9%的BUSCO基因,提示四倍体基因组可能通过互补补偿单个单倍型的基因缺失。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示了泛基因组大小估计和基因空间分析。a部分显示随着单倍型数量增加,泛基因组大小增长曲线拟合收敛于1.75 Gb,当前40条单倍型覆盖85%。b部分比较了四倍体欧洲马铃薯与二倍体马铃薯的泛基因组和核心基因组,显示欧洲马铃薯泛基因组较小且基因家族已饱和。c部分显示随机模拟四倍体基因组的基因家族数量分布,六个真实品种的基因家族数量显著低于随机期望,提示部分近交和有害等位基因负荷。

亮点 4|单倍型图实现短读长分相

将泛基因组转化为单倍型图(节点为100 kb单倍型特异性序列),通过短读长k-mer匹配估计节点拷贝数并连接成伪重叠群。对已包含在图中品种‘White Rose’的重建召回率达79.0%(染色体臂84.0%),伪重叠群N50为0.7 Mb(染色体臂1.0 Mb)。对衍生品种‘Kenva’和未知品种‘Russet Burbank’的重建覆盖约68-71%基因组,N50约0.6 Mb。与‘Russet Burbank’的de novo分相组装比较,87%的伪重叠群几乎完全比对到单一单倍型,验证了方法的可靠性。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示了单倍型图的构建和应用。a部分显示6号染色体的单倍型图,节点代表共享单倍型,不同单倍型分配到不同节点。b部分显示将‘Kenva’短读长k-mer映射到图上的结果,节点根据k-mer支持度着色(绿色=1拷贝,黄色=2拷贝,红色=3拷贝),用于估计拷贝数并连接成伪重叠群。c-f部分显示‘White Rose’、‘Kenva’和‘Russet Burbank’的重建统计,包括召回率、精确度、伪重叠群N50和基因组覆盖度,证明短读长分相的可行性。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: PacBio HiFi、Omni-C、hifiasm、Hi-C scaffolding、SyRI、D-statistics、minigraph、haplotype graph
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事作物基因组学、泛基因组分析、单倍型分相算法开发或马铃薯遗传育种的研究人员。

带走一句

四倍体作物的泛基因组可以转化为单倍型图,用短读长实现低成本、高通量的单倍型分相,为大规模育种群体分析开辟新路径。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。