IF36.1|CellSAM:通用细胞分割基础模型
一个模型搞定组织、细胞培养、酵母、细菌等各类细胞图像分割,性能媲美专家标注。
一个模型搞定组织、细胞培养、酵母、细菌等各类细胞图像分割,性能媲美专家标注。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
细胞分割是定量分析细胞成像实验的关键步骤。空间组学技术可以在组织中同时测量上百种蛋白和上千种RNA的位置与丰度,但要将这些数据转化为可解释的组织图谱,首先需要准确识别每个细胞的边界。活细胞成像则通过追踪细胞动态揭示细胞壁力学、信号传导、免疫细胞异质性等机制,同样依赖可靠的细胞分割与追踪。近年来,深度学习推动了细胞分割的进步,但主流方法多为针对特定模态或细胞类型的专用模型,难以跨领域泛化。例如,Mesmer适合组织图像但对细长细菌效果差,Cellpose需要维护模型动物园。此外,高质量标注成本高昂,每个细胞约0.01美元,限制了数据规模。基础模型在自然语言和视觉领域的成功为细胞分割提供了新思路,但将SAM等视觉基础模型直接应用于细胞图像仍面临挑战:细胞图像模态多样、单视野细胞数多、边界模糊,且SAM默认的自动提示策略(均匀网格点)不适合细胞密度变化大的场景。
科学问题
卡在哪里: 现有细胞分割模型多为专用模型,跨模态、跨细胞类型泛化能力差;SAM等基础模型虽然具有强大的特征提取和提示分割能力,但缺乏自动生成提示的机制,无法直接用于大规模细胞图像推理。此前尝试将SAM应用于生物图像的工作(如MicroSAM、MedSAM)主要聚焦于加速标注,未能实现可靠的自动分割。
本文要回答: 开发一个通用的细胞分割基础模型CellSAM,能够自动检测细胞并生成分割掩膜,在多种成像模态和细胞类型上达到人类水平,并支持零样本和少样本学习。
技术路线
作者主要用了:SAM、Anchor DETR、ViT、CellFinder、零样本学习、少样本学习。
作者首先整合了来自文献的多样化二维细胞图像数据集,涵盖组织、细胞培养、酵母、细菌、H&E染色和细胞核等类型,并严格划分训练/测试集以避免数据泄漏。然后,他们基于SAM构建CellSAM:利用SAM的ViT骨干提取图像特征,同时训练一个基于Anchor DETR的目标检测器CellFinder,从ViT特征中预测细胞边界框作为提示,再将这些提示与特征输入SAM的掩膜解码器生成实例分割。训练分两阶段:先训练CellFinder,再冻结ViT并微调SAM的neck层以适应细胞图像分布。这种设计使CellSAM能够自动生成提示,无需人工干预即可完成分割。

图 1 Fig. 1。图1展示了CellSAM的整体架构:输入图像被分割成规则采样的patch,经过ViT编码器生成图像特征。这些特征分别送入两个下游模块:CellFinder(基于Anchor DETR的检测器)从特征中解码出细胞的边界框提示;SAM的掩膜解码器结合特征和提示生成实例掩膜。该图清晰地说明了CellSAM如何将SAM的掩膜生成能力与目标检测结合,实现全自动推理。
核心亮点
亮点 1|构建大规模多样化细胞分割数据集
作者整合了10个公开数据集和一个内部数据集,涵盖组织、细胞培养、酵母、细菌、H&E和细胞核等六类,共计数百万个细胞标注。数据集包含荧光、明场、相差和质谱成像等多种模态,并严格去除了训练与测试之间的数据泄漏。该数据集为训练和评估通用模型提供了基础,其规模与多样性是CellSAM泛化能力的关键。

图 2 Fig. 2。图2a显示了用于训练和评估的数据集组成,按数据类型(组织、细胞培养、H&E、细菌、酵母、细胞核)给出了标注细胞数量,突出了数据集的多样性。图2b比较了CellSAM与Cellpose在不同数据类型上的分割误差(1−F1),CellSAM-generalist在所有类别上均低于Cellpose-generalist,且与Cellpose-specialist相当。图2c通过人类专家间一致性与CellSAM-专家一致性的比较,证明CellSAM达到人类水平。
亮点 2|CellSAM在多个数据集上超越通用模型
在10个数据集的基准测试中,CellSAM-generalist的F1误差显著低于Cellpose-generalist(包括预训练和内部训练的版本),且与针对单一数据集训练的Cellpose-specialist相当。例如,在组织数据上CellSAM误差降低约30%,在细菌数据上降低约50%。这表明CellSAM在保持通用性的同时,性能不输专用模型,解决了通用模型性能下降的难题。

图 3 Fig. 3。图3展示了CellSAM在空间转录组和活细胞成像中的应用。a部分示意了CellSAM如何作为通用分割模块嵌入不同分析流程。b部分显示CellSAM分割和追踪HeLa细胞,量化AMPK活性随时间变化。c部分展示酵母细胞谱系追踪和分裂计数。d部分展示三维分割结果。e部分展示在MERFISH数据中,CellSAM分割后可将mRNA点分配给单个细胞,实现单细胞基因表达分析。
亮点 3|达到人类水平的细胞分割精度
通过比较三位专家标注者之间的一致性(human vs human)与CellSAM预测和专家标注的一致性(human vs CellSAM),发现两者无显著差异(组织P=0.18,细胞培养P=0.49,酵母P=0.11,细菌P=0.90)。这说明CellSAM的分割结果与人类专家相当,其误差主要来源于标注者主观差异而非模型缺陷。
亮点 4|强大的零样本和少样本学习能力
在未参与训练的LIVECell数据集上,CellSAM的零样本性能大幅超越现有方法。进一步,仅用10个视野(约102-103个细胞)进行微调,即可在多数细胞系上显著提升性能(如A172细胞系F1从0.6提升至0.8)。但对于形态与训练数据差异过大的细胞系(如SH-SY5Y),微调效果有限,提示边界框提示策略的局限性。
亮点 5|赋能空间转录组和活细胞成像分析流程
CellSAM-generalist无需微调即可直接用于MERFISH和seqFISH空间转录组数据的细胞分割,结合Polaris分析流程实现单细胞基因表达定量。在活细胞成像中,CellSAM与细胞追踪算法结合,成功追踪HeLa细胞AMPK信号动态和酵母细胞谱系。此外,CellSAM还能分割三维图像,通过逐层分割和u-Segment3D融合实现三维重建。这些应用展示了CellSAM作为通用模块嵌入多种生物图像分析管线的潜力。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: SAM、Anchor DETR、ViT、CellFinder、零样本学习、少样本学习
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事空间组学、活细胞成像或任何需要细胞分割的生物信息学研究人员。
带走一句
通用基础模型在细胞分割上已能匹敌专用模型,做分析时不妨优先尝试CellSAM,省去为每个数据集训练专用模型的麻烦。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。