IF36.1|CyLinter:高多重组织图像单细胞分析的质控利器
成像伪影严重干扰单细胞分析,CyLinter通过人机交互质控显著提升聚类与细胞分型准确性。
成像伪影严重干扰单细胞分析,CyLinter通过人机交互质控显著提升聚类与细胞分型准确性。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
高多重组织成像技术(如CyCIF、CODEX、mIHC)可在单细胞水平同时检测20-100种蛋白,空间分辨率达亚细胞级别,单张切片可分析10^3-10^7个细胞。这类数据已成为scRNA-seq的重要补充,尤其适用于FFPE存档标本。然而,组织切片在制备、染色、成像及图像处理过程中常引入伪影,如组织折叠、抗体聚集体、碎片、光学像差和分割错误等。这些伪影在单细胞特征表中表现为异常信号,可能扭曲下游聚类和细胞分型。尽管已有MCMICRO等流程用于图像预处理和特征提取,但缺乏系统性的质控工具来识别和剔除受伪影影响的细胞。
科学问题
卡在哪里: 现有高多重成像分析流程缺乏针对伪影的质控环节。伪影细胞在特征空间中形成虚假聚类,或导致真实细胞类型混杂,严重影响生物学解释。尤其对于存档多年的临床标本(如TOPACIO试验),伪影普遍且无法重新制片,急需一种可交互的质控方法。
本文要回答: 开发一个交互式质控软件CyLinter,用于识别和去除高多重组织图像中的伪影细胞,并评估其对单细胞聚类和细胞分型的改善效果。
技术路线
作者主要用了:高多重成像、CyCIF、CODEX、mIHC、UMAP、HDBSCAN、Napari、人机交互质控。
作者收集了7个数据集(涵盖CyCIF、CODEX、mIHC),首先通过人工检查和聚类分析系统识别常见伪影类型及其对单细胞数据的影响。随后开发CyLinter,作为Napari插件,提供selectROIs、dnaIntensity、dnaArea、cycleCorrelation、pruneOutliers等模块,允许用户基于图像和特征分布交互式剔除伪影细胞。质控后重新聚类并与原始结果对比,验证CyLinter的改善效果。最后,作者还展示了基于深度学习的自动伪影检测初步结果。

图 1 Fig. 1。图1展示多种典型伪影及其对聚类的影响。a显示组织折叠导致SOX9和Hoechst信号异常,UMAP中形成独立cluster 1,且该簇所有通道z分数均偏高。c-f显示抗体聚集体、棉绒、坏死区域和气泡等伪影。g-l展示成像和图像处理错误,如失焦、拼接错误等。m-o显示循环成像中组织丢失导致细胞在后期通道信号缺失,形成伪影簇。
核心亮点
亮点 1|伪影驱动虚假聚类并混杂细胞类型
在CRC数据集中,HDBSCAN聚类产生22个簇,但其中多个簇由伪影驱动:cluster 6包含B细胞、T细胞和基质细胞;cluster 9和11由desmin和vimentin通道的抗体聚集体形成;cluster 12由棉绒纤维导致;cluster 14显示细胞丢失;cluster 10为未知来源的vimentin阳性区域。此外,cluster 2、8、19源于第3轮成像时抗体未覆盖的区域。这些伪影簇在UMAP中占据独立区域,但内部细胞类型混杂,严重干扰细胞分型。

图 2 Fig. 2。图2展示CRC数据集质控前的聚类结果。a为UMAP嵌入,22个簇。b显示部分簇轮廓系数为负。c热图显示四个meta-cluster。d显示cluster 6包含B细胞、T细胞和基质细胞。e-i展示由抗体聚集体、棉绒、细胞丢失和未知区域驱动的簇。j显示未暴露于抗体的区域。k-o显示正常细胞簇(如角质细胞、上皮细胞、记忆T细胞)的形态和标记表达。
亮点 2|TOPACIO数据集受伪影严重污染
TOPACIO数据集(25例TNBC标本)聚类产生492个簇,29%细胞未聚类。热图显示许多簇具有极亮或极暗的异常信号模式。人工评估发现约3.5%的图像瓦片受伪影影响,FOXP3通道超过30%瓦片存在非特异性染色。伪影丰度与活检类型相关(细针穿刺和粗针穿刺高于手术切除),但与治疗反应无关,表明伪影并非选择性偏倚。

图 3 Fig. 3。图3展示TOPACIO数据集质控前的聚类结果。a为UMAP嵌入,492个簇,29%细胞未聚类。b轮廓系数大多为正。c显示许多簇细胞数少于3000。d热图显示六个meta-cluster,但许多簇信号异常。e显示meta-cluster C信号正常。f-h展示伪影图像。i显示FOXP3通道伪影严重。j显示伪影丰度与治疗反应无关。
亮点 3|CyLinter质控显著改善聚类质量
对CRC数据集应用CyLinter后,去除约23%的细胞(主要为过分割),聚类数从22增加到78,且所有簇的轮廓系数均为正值。质控后簇对应明确的细胞类型:肿瘤、基质、记忆T细胞、巨噬细胞、B细胞和效应T细胞。原先混杂的cluster 6在质控后拆分为9个不同的细胞群体,包括vimentin+间充质细胞、记忆CD8+ T细胞和collagen IV+基质细胞。

图 4 Fig. 4。图4展示CyLinter工作流程和模块。a为模块示意图。b-e为输入文件。f显示负向ROI选择(CRC数据集)。g显示正向ROI选择(TOPACIO数据集)。h-i为dnaIntensity模块去除过暗和过亮核。j-k为dnaArea模块去除过分割和欠分割细胞。l为cycleCorrelation模块去除不稳定细胞。m为pruneOutliers模块去除通道离群值。
亮点 4|CyLinter挽救TOPACIO数据并揭示真实细胞类型
对TOPACIO数据集,CyLinter去除了84%的细胞,主要来自阳性ROI选择(53%)。质控后聚类得到43个簇,轮廓系数大多为正。细胞类型包括Treg(CD4+FOXP3+)、肿瘤细胞(panCK+γH2AX+)、常规CD4+ T细胞和巨噬细胞等。质控前cluster 415在质控后拆分为CD8+ T细胞、CD4+ T细胞、αSMA+基质细胞和CD68+巨噬细胞,表明伪影去除后细胞分型更准确。

图 5 Fig. 5。图5展示CRC数据集质控后的聚类结果。a显示各模块去除细胞比例。b为UMAP嵌入,78个簇。c轮廓系数为正。d热图显示六个meta-cluster。e-g展示质控后簇的细胞形态。h-j显示质控前cluster 6在质控后拆分为多个簇。k-l展示cluster 13中上皮和T细胞标记共表达,实为空间串扰。
亮点 5|深度学习模型初步实现自动伪影检测
作者基于CyLinter标注的伪影库训练了一个FPN深度学习模型,用于自动检测伪影。该模型在测试集上AUC约为0.73,表明方法可行但性能尚不足以完全替代人工审查。作者认为CyLinter是生成训练数据的理想工具,并建立了公共伪影库以促进模型改进。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 高多重成像、CyCIF、CODEX、mIHC、UMAP、HDBSCAN、Napari、人机交互质控
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/HMS-IDAC/S3segmenter、https://github.com/HMS-IDAC/UNetCoreograph、https://github.com/labsyspharm/cylinter;本地已克隆:S3segmenter、segmentation_models.pytorch、quantification、cylinter、cylinter-paper、UNetCoreograph
- 谁该点开原文: 从事高多重组织成像、空间单细胞分析的研究人员,以及关注临床标本存档数据质量的生信分析师。
带走一句
高多重成像数据必须进行质控,CyLinter提供人机交互的解决方案,能有效去除伪影细胞,显著提升聚类和细胞分型的准确性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。