周启涛生物技术工作室
单细胞与空间2025/10/30· 编译自 Nature Methods

IF36.1|Nicheformer:融合单细胞与空间组学的基础模型

用110M细胞预训练的Transformer,把空间微环境信息迁移到解离单细胞数据。

用110M细胞预训练的Transformer,把空间微环境信息迁移到解离单细胞数据。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

单细胞转录组(scRNA-seq)能解析细胞异质性,但解离过程丢失了空间位置和微环境信息。空间转录组技术(如MERFISH、Xenium、CosMx)可在原位测量数百到上千个基因,揭示细胞邻域组成、组织区域和niche结构。已有单细胞基础模型如Geneformer、scGPT、UCE在细胞类型注释、扰动预测等任务上表现优异,但它们大多只基于解离数据训练,未显式建模空间关系。CellPLM虽纳入空间数据,但训练规模小且下游任务有限。如何利用大规模空间数据学习包含空间上下文的细胞表示,并将其迁移到无空间信息的解离数据,是当前亟待解决的问题。

科学问题

卡在哪里: 现有单细胞基础模型几乎只从解离数据学习,无法捕捉空间微环境信息;而空间转录组数据量已足够大,但缺乏能同时整合两种模态、并支持空间相关下游任务的基础模型。

本文要回答: 构建一个在解离和空间转录组数据上联合预训练的基础模型,学习包含空间上下文的细胞表示,并验证其在下游空间任务和解离数据空间信息迁移上的优势。

技术路线

作者主要用了:Transformer、掩码语言建模、空间转录组、scRNA-seq、线性探测、微调

作者首先构建了SpatialCorpus-110M,包含57M解离细胞和53M空间细胞,覆盖人类和小鼠73种组织。然后设计Nicheformer,采用基于表达量排名的基因token化策略,并加入物种、模态、技术等上下文token。模型在掩码语言建模任务上预训练,学习基因间依赖和上下文信息。下游评估时,通过线性探测(冻结模型加线性层)和微调两种方式,在空间标签预测、邻域组成预测、邻域密度预测等任务上测试模型性能,并与Geneformer、scGPT、UCE、CellPLM、scVI、PCA等基线比较。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示Nicheformer的预训练数据概览和模型框架。a显示SpatialCorpus-110M包含解离和空间数据,UMAP可视化显示两种模态数据分布存在批次效应。b列出下游任务:空间标签预测、邻域组成和密度预测。c展示基因token化流程:按表达量排名并加入上下文token。d显示模型架构:12层Transformer,输入为基因token序列。e说明线性探测和微调两种评估方式。

核心亮点

亮点 1|空间标签预测全面超越基线

在MERFISH小鼠脑数据集上,Nicheformer对脑区和niche标签的预测macro F1显著高于Geneformer、scGPT、UCE、CellPLM、scVI和PCA。微调模型表现最佳,线性探测也超过多数基线。在CosMx人肝脏数据上,微调Nicheformer同样领先,但线性探测略逊于在训练集上训练的scVI和PCA,作者认为与肝脏数据在预训练集中占比低有关。此外,Nicheformer能将MERFISH定义的细胞类型、niche和区域标签准确迁移到scRNA-seq运动皮层数据,且预测不确定性低。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示SpatialCorpus-110M的构成。a显示解离数据来自17个器官、18个细胞系等,共57.06M细胞。b显示空间数据来自MERFISH、Xenium、CosMx、ISS四种技术,共53.83M细胞,覆盖15个器官。c展示元数据标准化流程,包括基因ID转换和ortholog映射。整体数据规模庞大且多样,为模型学习跨模态、跨物种表示提供基础。

亮点 2|邻域组成预测准确且可解释

在MERFISH小鼠脑、CosMx人肝和CosMx人肺三个数据集上,微调Nicheformer预测邻域细胞类型组成的平均绝对误差最低,优于所有基线。性能随邻域半径增大而提升,尤其在脑数据中。按细胞类型分析发现,高丰度且空间结构均一的细胞类型(如皮层谷氨酸能神经元)预测误差小,而稀有且分布复杂的细胞类型(如下丘脑谷氨酸能神经元)误差大。免疫细胞虽丰度低但预测较好,且其嵌入保留了区域信息。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示Nicheformer的注意力分析。a显示后期层对上下文token的注意力更高,且在不同组织和模态间一致。b显示中间层对基因token的注意力最高。c-e展示MERFISH小鼠脑AVPV区域的空间分布和细胞类型。f-i显示雄性vs雌性细胞对性二态基因的注意力差异,在特定层和头中显著,且包含未报道过的基因。

亮点 3|仅从表达谱推断局部细胞密度

在Xenium人肺和结肠数据上,Nicheformer嵌入通过线性回归预测邻域细胞密度,R²为正且显著优于scVI和PCA(后者R²为负)。模型能准确反映肿瘤区域更高的细胞密度,并识别致密组织结构。这表明Nicheformer的细胞表示中编码了局部密度信息,可用于向解离数据注入空间背景。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示空间标签预测和迁移结果。a显示MERFISH小鼠脑切片上的niche标签。b显示Nicheformer在脑区和niche预测上的macro F1高于所有基线。c-k展示将MERFISH标签迁移到scRNA-seq运动皮层数据的结果,细胞类型、niche和区域标签均能准确预测,且不确定性低。

亮点 4|注意力模式揭示层级化特征提取

分析Nicheformer的注意力矩阵发现,早期层注意力分布广泛,中间层聚焦于特定基因,后期层则集中关注上下文token(物种、模态、技术)。这种层级模式在不同组织和模态间一致。部分注意力头在不同数据集中保持稳定功能(如关注高表达基因),另一些则呈现模态特异性。在MERFISH小鼠脑AVPV区域,雄性vs雌性细胞对性二态基因的注意力差异在特定层和头中显著,且模型能捕捉到未报道过的性二态相关基因。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5展示邻域组成预测任务。a定义邻域半径和组成。b显示不同半径下邻域大小的分布。c显示微调Nicheformer在三个数据集上的平均绝对误差最低。d显示按细胞类型分组的预测误差,高丰度且空间均一的细胞类型误差小。e显示免疫细胞嵌入保留区域信息,UMAP中可区分不同脑区来源。

亮点 5|多模态多物种预训练至关重要

消融实验显示,仅用解离数据预训练的模型(即使数据量三倍于空间数据)在下游空间任务上表现更差;仅用单一物种数据预训练的模型在另一物种上性能下降。这些差异具有统计显著性。此外,使用ortholog基因映射构建跨物种词表对小鼠脑任务有正面影响,但在人肝和肺任务上影响不大。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: Transformer、掩码语言建模、空间转录组、scRNA-seq、线性探测、微调
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 做单细胞或空间组学分析、对基础模型感兴趣的生信研究者。

带走一句

空间信息可以从表达谱中学习并迁移,做分析时不妨用Nicheformer为解离数据补充空间上下文。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。