IF36.1|CREsted:跨组织物种建模与设计细胞类型特异性增强子
一个Python包,从scATAC-seq训练增强子模型,解析调控语法并设计合成增强子。
一个Python包,从scATAC-seq训练增强子模型,解析调控语法并设计合成增强子。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
增强子是驱动细胞类型身份的主要顺式调控元件,其活性由转录因子结合位点的组合、强度、拷贝数和排列方式决定,即“增强子代码”。这种逻辑具有简并性,难以用简单规则描述。深度神经网络已成为建模这些复杂规则的有力工具,尤其是序列到功能模型,能够从DNA序列预测染色质可及性、转录因子结合和增强子活性。其中,单细胞ATAC-seq(scATAC-seq)数据因能提供细胞类型特异性的染色质可及性信息,成为解码增强子的理想数据源。已有软件包如Selene、EUGENe、ChromBPNet、scPrinter、Ledidi和gReLU等提供了部分功能,但缺乏针对跨细胞类型增强子代码建模和设计的完整流程,且未在大规模复杂scATAC-seq图谱上充分验证。
科学问题
卡在哪里: 现有工具要么专注于单一细胞类型的足迹分析,要么是通用框架,未针对多细胞类型增强子建模进行优化;缺乏从数据预处理、模型训练、增强子代码解析到合成增强子设计的端到端解决方案,且未在跨组织、跨物种的大规模scATAC-seq图谱上验证其有效性和可扩展性。
本文要回答: 开发一个用户友好的Python包CREsted,整合scATAC-seq数据预处理、序列到功能模型训练、细胞类型特异性增强子代码分析和合成增强子设计,并在多种生物系统中验证其性能。
技术路线
作者主要用了:scATAC-seq、深度学习、迁移学习、基序分析、in silico进化。
CREsted包含四个模块:数据预处理(主题建模或伪批量峰聚合)、模型训练(回归或分类,支持从头训练和基于Enformer/Borzoi的迁移学习)、增强子代码分析(梯度贡献、TF-MoDISco、模式聚类与TF匹配)和增强子设计(in silico进化或基序植入)。作者首先在小鼠运动皮层scATAC-seq数据上训练DeepBICCN2模型,验证预测性能并解析细胞类型特异性基序;随后在人类PBMC数据上训练DeepPBMC,通过ChIP-seq验证预测的TFBS;接着在癌细胞系和胶质瘤活检数据上比较MES样增强子代码;最后在斑马鱼发育图谱上训练DeepZebrafish,设计并体内验证细胞类型特异性增强子。

图 1 Fig. 1。图1展示CREsted软件包的整体流程:从预处理scATAC-seq数据获得细胞类型可及性值,训练序列基增强子模型(支持从头训练或迁移学习),进行多输出回归或多标签分类,然后通过核苷酸贡献分析解析细胞类型特异性增强子代码,并设计合成增强子序列。该图概括了工具的四个模块及其相互关系。
核心亮点
亮点 1|DeepBICCN2准确预测小鼠皮层染色质可及性
在小鼠运动皮层scATAC-seq数据上,CREsted训练的DeepBICCN2模型在测试集上达到Spearman ρ=0.79和Pearson r=0.82(log转换后),显著优于gReLU框架训练的模型(P<0.001)。模型不仅能预测未见过的峰,还能以100bp滑动窗口准确预测基因座水平的可及性(如Chsy3基因,r=0.75),并跨物种预测鸡UACA基因座(r=0.62)。在171个体内验证的增强子上,模型分类平均精度0.77,召回率0.79。通过贡献分数和模式聚类,识别出TBR1、NFI、RFX3、EGR、SOX10、SPI1等细胞类型特异性TF,并发现SstChodl细胞特有的E-box基序(CAGGTG),突变该基序可改变细胞类型特异性预测。

图 2 Fig. 2。图2展示DeepBICCN2在小鼠运动皮层数据上的性能。a为scATAC-seq UMAP图;b为预测与真实峰高的散点图,显示高相关性;c为各细胞类型间的Pearson相关热图,对角线最高;d为与gReLU模型的性能比较,CREsted显著更优;e为Chsy3基因座的滑动窗口预测与真实可及性轨迹对比;f为三个验证增强子的贡献分数;g为模式聚类热图,揭示细胞类型特异性基序。
亮点 2|DeepPBMC恢复验证的TFBS并解析IFNB1增强体
在人类PBMC数据上训练的DeepPBMC模型(r=0.71)成功恢复了CD79A增强子(B细胞)和TCRα增强子(T细胞)中所有实验验证的TFBS,并额外识别出IRF8、REL和ETS-like位点。对于树突细胞特异性的IFNB1增强体,模型识别出大部分复杂性,仅缺失p50、c-Jun和一个IRF位点。与Borzoi相比,DeepPBMC识别出多34%的重要核苷酸。通过ChIP-seq验证,模型预测的TFBS具有高精度(平均精度0.75),且在使用UniBind直接结合位点后召回率大幅提升。此外,模拟EBF1降解实验显示,模型预测的染色质可及性变化与实际数据高度相关(r=0.55和0.60)。

图 3 Fig. 3。图3展示DeepPBMC在人类PBMC数据上的分析。a为区域嵌入的t-SNE图,按细胞类型分离;b为CD79A和TCRα增强子的贡献分数,恢复已知TFBS;c为IFNB1增强体的贡献分数,解析复杂基序;d为模式聚类热图;e和f为ChIP-seq验证的精度-召回曲线;g为ChIP-seq信号在seqlets上的聚集;h和i为EBF1降解模拟与真实数据的比较。
亮点 3|MES样增强子代码在癌细胞系与活检中部分共享
在癌细胞系上训练的DeepCCL模型将黑色素瘤和胶质母细胞瘤的MES样状态聚类在一起,共享AP-1、TEAD、RUNX、NFI和ATF/CREB等基序。在胶质瘤活检数据上训练的DeepGlioma主题分类模型识别出与MES样细胞系最相关的主题8,但贡献分数相关性低于细胞系之间的相似性。比较发现,AP-1和CREB/ATF基序在细胞系和活检中共享,而TEAD基序特异于细胞系,SOX和RFX基序特异于活检。这表明细胞系中的MES样增强子逻辑并未完全在肿瘤中重现。

图 4 Fig. 4。图4展示癌细胞系和胶质瘤活检中MES样增强子代码的比较。a为DeepCCL和DeepGlioma模型概述;b为DeepCCL预测的相关热图,MES样细胞系聚类;c为与ChromBPNet的性能比较;d为AXL增强子的贡献分数;e为共享基序;f为胶质瘤主题的UMAP;g为贡献分数相关性热图,显示主题8与MES样细胞系最相关;h和i为细胞系与活检中基序的差异。
亮点 4|CREsted模型与微调Borzoi相当,优于基座模型
DeepBICCN2与微调后的Borzoi模型在细胞类型特异性染色质可及性预测上表现相当,但基座Borzoi模型在区分GABAergic和glutamatergic神经元亚类时表现较差,对171个验证增强子的分类平均精度远低于DeepBICCN2和微调Borzoi。此外,微调自监督基因组语言模型HyenaDNA和Nucleotide Transformer的性能不如从头训练的CREsted模型或微调Borzoi,尽管参数数量更大。这表明对于高分辨率细胞类型特异性预测,微调或从头训练是必要的。

图 5 Fig. 5。图5展示Borzoi迁移学习策略及与CREsted模型的比较。a为微调流程示意图;b为不同模型在测试集上的平均r比较;c为在外部数据集上的性能比较;d为对171个验证增强子的分类性能;e为不同模型识别的基序比较。结果显示DeepBICCN2与微调Borzoi相当,基座Borzoi在高分辨率细胞类型上表现不佳。
亮点 5|DeepZebrafish设计体内验证的细胞类型特异性增强子
在斑马鱼发育scATAC-seq图谱上训练的DeepZebrafish模型(639个细胞类型-时间点组合)成功预测了54个验证增强子中74%的细胞类型特异性。利用in silico进化(ISE)和L2距离成本函数,设计了针对心肌、体肌和内皮细胞的增强子。体内报告基因实验显示,所有心肌和体肌增强子均特异性地在靶细胞类型中活跃,但心肌增强子效率较低;内皮增强子中仅一个具有强特异性活性。此外,设计了双特异性增强子(心肌/体肌),大多数实现了双活性,但表达强度控制仍具挑战。基序分析揭示心肌和体肌共享MEF、TEAD和E-box基序,而心肌还包含GATA和NKX基序。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: scATAC-seq、深度学习、迁移学习、基序分析、in silico进化
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事单细胞表观基因组学、增强子生物学或深度学习在基因组学中应用的研究人员。
带走一句
CREsted为scATAC-seq增强子建模提供了端到端、可扩展的解决方案,其多类模型和优化流程能有效解析细胞类型特异性调控语法,并支持跨物种预测和合成增强子设计。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。