IF36.1|基因级单细胞轨迹对齐框架 Genes2Genes
新框架 Genes2Genes 可在单基因水平对齐单细胞轨迹,精准捕捉匹配与错配。
新框架 Genes2Genes 可在单基因水平对齐单细胞轨迹,精准捕捉匹配与错配。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
单细胞转录组技术能够同时观测数千个基因,从而描述细胞状态的动态变化,例如分化、发育或对扰动的响应。为了比较不同条件下的动态过程(如对照与药物处理、体外分化与体内发育),研究者通常先推断伪时间轨迹,然后采用动态规划算法(如动态时间规整 DTW)进行轨迹对齐。现有方法如 CellAlign 和 TrAGEDy 虽然被广泛使用,但存在明显局限:DTW 假设每个参考时间点至少匹配一个查询时间点,无法识别插入或缺失(indels)导致的错配,且距离度量仅考虑均值差异而非分布差异。这些限制使得现有方法难以准确捕捉轨迹间的分歧与收敛模式,也无法在基因水平上解析异质性。
科学问题
卡在哪里: 现有轨迹对齐方法(如 CellAlign、TrAGEDy)基于 DTW,其核心假设是参考与查询轨迹间存在一一对应关系,无法识别错配(插入/缺失),且距离度量仅基于均值差异,忽略了基因表达分布的方差信息。此外,这些方法产生单一的整体对齐,掩盖了不同基因可能具有的不同对齐模式,无法在单基因水平上解析轨迹差异。
本文要回答: 本文旨在开发一个能在单基因水平对齐单细胞轨迹的新框架,能够同时捕获匹配和错配,并支持下游分析如聚类和通路富集。
技术路线
作者主要用了:scRNA-seq、动态规划、贝叶斯信息论、MML距离、层次聚类。
作者开发了 Genes2Genes (G2G) 框架,其核心是一个扩展了 Gotoh 算法的动态规划模型,该模型整合了 DTW 和 gap 建模,定义了五种对齐状态(M、V、W、I、D)。G2G 首先对参考和查询的基因表达轨迹进行分布插值,然后使用基于最小消息长度(MML)准则的贝叶斯信息论距离度量来评估时间点之间的匹配代价,并通过一个五状态机模型来分配状态转移代价。最终,G2G 为每个基因生成一个五状态字符串,这些字符串可用于聚类分析、聚合对齐和通路富集等下游分析。

图 1 Fig. 1。图1展示了单细胞轨迹对齐的概念和五种对齐状态。a 部分示意参考和查询轨迹的匹配与错配如何支持下游分析;b 部分定义了五种状态(M、V、W、I、D)及其理论来源,其中 DTW 仅包含 M、V、W,而 G2G 扩展了 gap 建模。c 部分通过成本矩阵和路径示例说明 DP 如何生成对齐;d 部分展示了一个基因的五状态对齐字符串,直观呈现匹配和错配的时序模式。
核心亮点
亮点 1|G2G 在模拟数据上优于现有方法
在包含七种对齐模式(匹配、早期/中期/晚期分歧、早期/中期/晚期收敛)的模拟数据集上,G2G 的基因级对齐准确率高达 98.2%–100%,显著优于 TrAGEDy 的两种变体(TrAGEDyMINIMUM 和 TrAGEDyNULL),后者准确率在 5.4%–100% 之间波动且变异较大。CellAlign 无法描述分歧和收敛模式。此外,G2G 的层次聚类能以 0.1% 的误聚类率分离七种模式,远低于 CellAlign 的 k-means 聚类(误聚类率 42.6%–60.4%)。在无共享过程的阴性对照数据上,G2G 正确生成 100% 错配的聚合对齐,而 TrAGEDy 错误推断出匹配片段。

图 2 Fig. 2。图2概述了 G2G 框架的工作流程。输入为参考和查询的 log1p 标准化表达矩阵及伪时间估计。G2G 首先对每个基因轨迹进行分布插值,然后运行扩展的 Gotoh DP 算法,该算法使用基于 MML 的距离度量和五状态机模型。生成的基因对齐字符串被聚类,并用于计算聚合对齐和下游分析。图中还展示了 MML 距离计算的示意图和五状态机的转移概率。
亮点 2|G2G 在真实数据中揭示基因级错配
在 PAM 与 LPS 刺激的树突状细胞时间序列数据上,G2G 不仅重现了 CellAlign 发现的 PAM 刺激后基因表达的滞后,还识别出早期和晚期伪时间点的错配。例如,在早期,LPS 刺激的细胞中 IRF7、STAT2 和 IFIT1 等基因出现“早熟表达”,而 PAM 刺激的细胞表达仍低;在晚期,LPS 刺激的基因表达达到峰值后下降,而 PAM 刺激的细胞仍在上升。聚类分析揭示了不同基因簇的特异性对齐模式,并识别出 SGMS2 为最相似基因,CCRL2 和 C5AR1 为高度不相似基因,其中 TNF 尽管 log fold change 不显著,但轨迹对齐显示其高度不相似,凸显了轨迹对齐在检测差异表达基因方面的优势。

图 3 Fig. 3。图3比较了 CellAlign、TrAGEDy 和 G2G 的算法差异及在模拟数据上的表现。a 部分说明 CellAlign 仅使用 DTW 且状态空间为 [M, W, V],而 TrAGEDy 和 G2G 均包含 gap 建模,但 G2G 统一了 DTW 和 gap 建模。b 部分展示三种方法在模拟轨迹上的对齐结果,G2G 能准确识别匹配和错配区域。c-e 部分显示 G2G 在七种模拟模式上的基因级对齐准确率高于 TrAGEDy,且聚类效果更好。f 部分展示 G2G 的层次聚类能清晰分离七种模式。g 部分显示 CellAlign 和 TrAGEDy 的聚类噪声更大。h 部分展示在无共享过程的阴性对照数据上,G2G 生成 100% 错配,而 TrAGEDy 错误推断出匹配。
亮点 3|G2G 发现 IPF 中早期/晚期差异
在健康肺与特发性肺纤维化(IPF)肺的 AT2 细胞分化轨迹比较中,G2G 的聚合对齐显示仅在晚期伪时间点出现错配,这与健康肺分化为 AT1 细胞而 IPF 分化为异常基底样细胞(ABCs)的已知生物学一致。对错配基因(对齐相似度≤40%)进行通路富集分析,发现上皮间充质转化(EMT)是最显著富集的通路。进一步聚类揭示了一些基因在早期/中期就出现错配,如 NNMT、CXCL1 和 CXCL8,这些可能成为阻止病理性 ABC 分化的潜在治疗靶点。

图 4 Fig. 4。图4展示了 G2G 在 PAM 与 LPS 刺激的树突状细胞时间序列数据上的对齐结果。a 部分为实验设计示意图。b 部分显示 99 个核心抗病毒基因的聚合对齐,顶部堆叠条形图显示参考和查询的细胞组成,底部矩阵显示时间点间的匹配基因计数。c 部分展示 IRF7、STAT2 和 IFIT1 等基因的个体对齐,显示早期错配。d 部分展示峰值炎症模块基因的聚合对齐和聚类结果。e 部分展示不同簇的代表基因对齐。f 部分展示对齐相似度统计,识别出 SGMS2 为最相似基因,CCRL2 和 C5AR1 为高度不相似基因。
亮点 4|G2G 揭示体外 T 细胞发育的 TNF 信号缺失
在人工胸腺类器官(ATO)体外分化 T 细胞与体内胎儿参考 T 细胞发育轨迹的比较中,G2G 对齐显示早期和晚期存在错配。早期错配归因于体外起始于 iPS 细胞而体内起始于造血干细胞,晚期错配则与 TNF 信号通路相关。通路富集分析发现 TNF 信号通过 NF-κB 通路是最显著富集的错配基因集,其中 FOSB、JUNB 和 NR4A2 等转录因子在体内成熟 T 细胞中表达上调,但在体外缺失。实验验证表明,在 ATO 培养的最后一周添加 TNF 可降低体外 SP T 细胞与体内 1 型固有 T 细胞之间的基因表达距离,并上调 IL7R 等成熟标志物,表明 TNF 信号是优化体外 T 细胞成熟的重要靶点。

图 5 Fig. 5。图5展示了 G2G 在健康与 IPF 肺 AT2 细胞分化轨迹上的对齐结果。a 部分为实验设计示意图。b 部分显示所有高变基因的聚合对齐,显示晚期错配。c 部分展示 ABC 特异性标志基因的对齐,显示分歧模式。d 部分展示 EMT 通路富集结果。e 部分展示 CAMK1D 等基因的个体对齐,显示几乎完全错配。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: scRNA-seq、动态规划、贝叶斯信息论、MML距离、层次聚类
- 公开数据: GSE136831、E-MTAB-12720
- 代码: 公开仓库 https://github.com/Teichlab/G2G_notebooks、https://github.com/Teichlab/Genes2Genes;本地已克隆:Genes2Genes
- 谁该点开原文: 从事单细胞轨迹分析、发育生物学、疾病机制研究或体外分化优化的科研人员。
带走一句
G2G 提供了一种在单基因水平上对齐单细胞轨迹的新方法,能够揭示现有方法无法检测的错配和异质性,为疾病机制研究和体外分化优化提供了有力工具。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。