周启涛生物技术工作室
发育与进化2024/11/14· 编译自 Nature Methods

IF36.1|人类胚胎单细胞参考图谱及在线预测工具

整合六套人类胚胎scRNA-seq数据,构建从受精卵到原肠胚的参考图谱,并开发在线工具用于胚胎模型验证。

整合六套人类胚胎scRNA-seq数据,构建从受精卵到原肠胚的参考图谱,并开发在线工具用于胚胎模型验证。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

基于干细胞的胚胎模型为研究早期人类发育提供了前所未有的实验工具。这些模型的有用性取决于它们在分子、细胞和结构上对体内对应物的保真度。为了验证人类胚胎模型,单细胞RNA测序已被用于无偏转录组分析。然而,一个组织良好、整合的人类单细胞RNA测序数据集,作为基准测试人类胚胎模型的通用参考,仍然缺失。此前已有多个独立的人类胚胎转录组数据集发表,覆盖从受精到原肠胚形成的阶段,但缺乏统一整合。

科学问题

卡在哪里: 尽管已有多个独立的人类胚胎scRNA-seq数据集,但缺乏一个整合的、可作为通用参考的数据集来系统评估胚胎模型的细胞类型注释准确性。此外,现有注释方法在区分共享标记的细胞谱系(如滋养层与羊膜)时存在误判风险。

本文要回答: 构建一个覆盖受精卵到原肠胚阶段的人类胚胎单细胞转录组参考图谱,并开发一个用户友好的在线预测工具,用于基准测试和验证干细胞来源的胚胎模型。

技术路线

作者主要用了:scRNA-seq、fastMNN整合、SCENIC、Slingshot轨迹推断、SVM分类器、UMAP投影

作者收集六套已发表的人类胚胎scRNA-seq数据集,统一使用GRCh38参考基因组重新处理,通过fastMNN整合消除批次效应,构建高分辨率转录组图谱。利用SCENIC分析转录因子调控网络,Slingshot推断主要谱系轨迹,并鉴定谱系特异性标记基因。随后,将整个流程封装为查询投影和细胞类型预测工具,通过将查询数据投影到参考UMAP空间并用SVM分类器预测细胞身份。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示整合六套人类胚胎数据集的UMAP投影,不同颜色代表数据来源和细胞注释。UMAP显示从受精卵到原肠胚的连续发育轨迹,包括ICM/TE分化和上胚层/下胚层分叉。点图展示前五个谱系特异性标记基因的表达,验证注释可靠性。

核心亮点

亮点 1|整合六套数据构建参考图谱

整合六套已发表的人类胚胎scRNA-seq数据集,覆盖从受精卵到原肠胚(CS7)的发育阶段,共3,304个细胞。UMAP显示连续的发育轨迹,包括ICM/TE分化、上胚层/下胚层分叉以及滋养层分化为CTB、STB和EVT。SCENIC分析确认了已知谱系特异性转录因子,如DUXA在8细胞期、VENTX在上胚层、OVOL2在TE等。Slingshot轨迹推断揭示了上胚层、下胚层和TE三条主要发育路径,并鉴定了沿伪时间变化的转录因子。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示查询数据投影和细胞类型预测的工作流程。包括重缩放标准化、PCA子空间投影、MNN校正和UMAP投影。SVM分类器在20维潜在空间中训练,用于预测细胞身份。测试五个胚胎数据集,主谱系预测准确率达0.982,kappa值0.961。

亮点 2|跨物种整合验证注释可靠性

将人类数据集与食蟹猴和狨猴的胚胎scRNA-seq数据整合,发现主要谱系发育在灵长类中保守。跨物种分析支持了人类参考图谱的注释,并帮助重新注释了53个原为Adv_Mes的细胞为ExE_Mes。此外,鉴定了人类谱系特异性基因,如FAM124A、MUSTN1、LIM2和ADAM15。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示naive和primed hPS细胞及其衍生TLC的投影结果。naive hPS细胞映射到早期上胚层,primed映射到晚期上胚层。primed来源TLC包含羊膜和ExE_Mes细胞群。Venn图显示TLC与胚胎TE的差异表达基因重叠。

亮点 3|稳定投影与SVM预测工具

开发了早期胚胎发生预测工具,将查询数据投影到参考UMAP空间并用SVM分类器预测细胞身份。在五个额外胚胎数据集上测试,主谱系预测准确率达0.982,kappa值0.961;亚谱系准确率0.912,kappa值0.874。性能优于SingleR、scMap和ScType。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示囊胚样模型的投影结果。naive hPS细胞来源的囊胚样模型包含预期的ELC、HLC和TLC,但部分细胞显示植入后谱系特征。EPS细胞来源或重编程来源的囊胚样模型存在谱系偏差。Venn图显示与胚胎谱系相比的差异表达基因。

亮点 4|揭示干细胞衍生滋养层细胞的异质性

将naive和primed hPS细胞来源的TLC投影到参考图谱,发现naive来源主要映射到早期TE,而primed来源包含羊膜和ExE_Mes细胞群。与胚胎TE相比,TLC存在差异表达基因,primed来源TLC中DNMT3L和XIST表达缺失,提示表观遗传异常。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示多种干细胞来源的植入后胚胎模型的投影结果。多数模型包含上胚层、原条、中胚层、ExE_Mes和羊膜等细胞类型。基于囊胚样模型在TE区室贡献最佳。Hislop等人的模型成功建立卵黄囊造血。

亮点 5|评估囊胚样模型的细胞组成

投影多种囊胚样模型,发现naive hPS细胞来源的囊胚样模型包含预期的ELC、HLC和TLC,但部分细胞显示植入后谱系特征。EPS细胞来源或重编程来源的囊胚样模型存在谱系偏差,如TLC更接近羊膜或ExE_Mes。GSEA显示不同囊胚样模型在能量代谢和粘附通路存在差异。

亮点 6|评估植入后胚胎模型

将多种干细胞来源的植入后胚胎模型投影到参考图谱,发现多数模型包含上胚层、原条、中胚层、ExE_Mes和羊膜等细胞类型。基于囊胚样模型在TE区室贡献最佳。Hislop等人的模型成功建立卵黄囊造血,尽管缺乏TE。部分模型中的羊膜细胞注释存在争议,可能由于标记基因表达不足或细胞数量过少。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

带走一句

构建参考图谱并开发在线预测工具,为胚胎模型验证提供标准化基准,避免因缺乏合适参考而导致的细胞类型误注释。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。