IF36.1|scooby:从DNA序列预测单细胞多组学谱
用Borzoi加细胞解码器,scooby把单细胞ATAC和RNA预测推到新高度。
用Borzoi加细胞解码器,scooby把单细胞ATAC和RNA预测推到新高度。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
理解调控序列如何塑造单个细胞的基因表达是基因组学的核心挑战。单细胞多组学技术(如10x Multiome)能同时测量同一细胞的染色质可及性(scATAC-seq)和基因表达(scRNA-seq),为解析细胞状态特异的调控逻辑提供了数据基础。深度学习模型(如Enformer、Borzoi)已能从DNA序列预测bulk水平的组学谱,但bulk模型无法捕捉细胞异质性。已有单细胞序列模型(如scBasset、seq2cells)或只预测染色质可及性,或仅预测基因表达且扩展性差。因此,需要一种能联合建模单细胞多组学谱、可扩展且无需基因注释的框架。
科学问题
卡在哪里: 现有单细胞序列模型要么只建模染色质可及性,要么只建模基因表达,且seq2cells依赖TSS注释、每个细胞一个输出头导致计算不可扩展。bulk模型(Borzoi)虽能预测RNA-seq覆盖度,但无法区分细胞状态。
本文要回答: 本文旨在开发一个从DNA序列联合预测单细胞scATAC-seq插入和scRNA-seq覆盖度的模型,并验证其在基因表达预测、TF活性推断和变异效应解析上的能力。
技术路线
作者主要用了:scRNA-seq、scATAC-seq、Borzoi、LoRA微调、Poisson-MultiVI、TF motif effect score。
作者以预训练的bulk多组学模型Borzoi为基础,保留其序列编码器,加入低秩适应(LoRA)模块进行参数高效微调,使其适应单细胞数据特征(如3'端偏好)。同时设计了一个轻量级细胞状态解码器,利用Poisson-MultiVI生成的低维细胞嵌入动态生成卷积权重,将序列嵌入转换为细胞特异的RNA和ATAC谱。训练时采用与Borzoi相同的序列划分,并在10x Multiome骨髓数据集(63,683个细胞)上微调。该设计使模型参数不随细胞数增长,且能泛化到未见的相似细胞状态。

图 1 Fig. 1。图1展示了scooby的模型架构:Borzoi序列编码器经LoRA微调后输出32-bp分辨率的序列嵌入,细胞状态解码器利用Poisson-MultiVI嵌入动态生成卷积权重,预测单细胞ATAC插入和RNA覆盖。右图UMAP显示骨髓多组学数据的细胞类型分布,下方示例位点SLC25A37的预测谱与100近邻平均谱高度一致,且能区分MEP和红细胞母细胞的差异表达与可及性。
核心亮点
亮点 1|单细胞谱预测优于伪bulk
scooby在测试序列上预测的单细胞RNA和ATAC谱与观测值的Pearson相关分别为0.15和0.11,高于伪bulk的0.09和0.08。与100近邻平均谱的相关性达0.63和0.70,表明模型有效捕捉了稀疏单细胞数据下的真实信号。模型还准确预测了scRNA-seq的3'端覆盖偏好,并在SLC25A37位点展示了细胞类型特异的差异调控。

图 2 Fig. 2。图2评估基因表达预测。a示意将预测覆盖度在exon上求和得到基因计数。b显示标记基因(ANK1、DIAPH3等)在测试细胞中的预测与观测表达模式一致。c-d展示伪bulk水平跨细胞类型相关性达0.86,去除均值后为0.54。e显示scooby优于seq2cells。f-g展示剔除normoblast后模型仍能准确预测其表达及HEMGN沿红细胞分化轨迹的动态。
亮点 2|基因表达预测超越seq2cells
在伪bulk基因表达评估中,scooby跨细胞类型的平均Pearson相关为0.86,与Borzoi在bulk RNA-seq上的表现相当。去除基因和细胞类型均值后,相关性为0.54,表明模型捕获了细胞类型间的差异表达。与seq2cells相比,scooby在共享测试基因上的跨基因相关性从0.77提升至0.87,跨细胞类型相关性从0.43提升至0.55。

图 3 Fig. 3。图3展示TF motif效应分析。a示意in silico突变TF结合位点并计算效应分数。b-c显示scooby的TF motif效应评分与TF表达的相关性显著高于chromVAR和scBasset,且仅用RNA训练的模型也表现优异。d热图显示谱系特异性TF家族(GATA1、EBF1等)的效应模式。e显示GATA1 motif突变对可及性的影响早于对表达的影响。f-i展示在心脏类器官JCF群体中,scooby的TF效应评分与CellRank命运概率相关,识别出心肌和心外膜命运驱动因子。
亮点 3|未见细胞状态的泛化能力
在训练时完全剔除normoblast细胞后,scooby对normoblast的基因表达预测Pearson相关仍达0.79(完整模型为0.81)。使用normoblast嵌入作为解码器输入时预测最佳,表明模型在嵌入空间中学习了有意义的细胞状态表示,可插值到相近但未见的细胞状态。在红细胞分化轨迹上,HEMGN基因的表达动态被准确重现(Pearson R=0.966)。

图 4 Fig. 4。图4评估变异效应预测。a-b显示scooby在OneK1K细胞类型上预测eQTL效应与观测值的Spearman相关显著高于Borzoi和seq2cells。c显示scooby对GTEx全血eQTL的预测效应分布,过滤掉小效应后相关性提升至0.78。d显示符号一致率随TSS距离下降,但非可忽略效应预测保持高一致率。e-f显示scooby在eQTL细胞类型反卷积中优于基于靶基因表达和ATAC可及性的基线。
亮点 4|TF motif效应评分优于chromVAR
scooby的TF motif效应评分与TF表达的相关性显著高于chromVAR(P=5.4×10^-9)和scBasset(P=0.04)。仅用scRNA-seq训练的scooby也达到或超过基于scATAC-seq的chromVAR和scBasset,表明scooby无需匹配的染色质可及性数据即可推断TF活性。在造血谱系中,scooby正确识别了GATA1、EBF1、C/EBP、RUNX等谱系特异性TF。

图 5 Fig. 5。图5展示scooby对bulk eQTL的细胞类型特异性解析。a聚类热图显示eQTL效应在细胞类型间的变异,红系、单核和早期祖细胞呈现独特模式。b显示与GWAS性状匹配的细胞类型特异eQTL示例(如SLC14A1与网织红细胞未成熟分数)。c-e以TES基因的rs143664050为例,scooby预测该变异在单核细胞中破坏SPI1结合位点导致表达下降,而在红系细胞中无效应,与SPI1的细胞类型特异表达一致。
亮点 5|细胞类型特异的eQTL效应预测
在OneK1K单细胞eQTL数据集上,scooby显著优于Borzoi(所有细胞类型)和seq2cells(P=5×10^-4)。对于预测效应非可忽略的GTEx eQTL,scooby与观测效应的Spearman相关从0.45提升至0.78,符号一致率达91.6%。在eQTL细胞类型反卷积任务中,scooby优于基于靶基因表达或ATAC可及性的基线方法。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: scRNA-seq、scATAC-seq、Borzoi、LoRA微调、Poisson-MultiVI、TF motif effect score
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 做单细胞多组学、调控基因组学或eQTL分析的生信研究者。
带走一句
scooby证明用细胞嵌入作为条件,可以让bulk序列模型泛化到单细胞水平,且无需匹配多组学数据也能推断TF活性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。