IF50.5|多组学与深度学习解析人类发育调控语法
单细胞多组学+深度学习,系统解码人类胎儿发育中染色质可及性的调控语法。
单细胞多组学+深度学习,系统解码人类胎儿发育中染色质可及性的调控语法。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
转录因子通过序列特异性结合调控DNA,在发育过程中建立细胞身份,常促进局部染色质可及性并调节基因表达。染色质可及性图谱是解析转录调控的关键,但现有的人类发育数据集局限于bulk组织、单个器官或单一组学模式,无法在细胞类型水平上系统揭示调控元件和转录因子结合位点的组织规律。单细胞多组学技术(如SHARE-seq)可同时捕获同一细胞的染色质可及性和基因表达,为在发育背景下研究细胞类型特异性的顺式调控逻辑提供了可能。
科学问题
卡在哪里: 此前缺乏覆盖多器官、多组学的人类发育单细胞图谱,无法在细胞类型水平上系统鉴定调控元件和转录因子结合位点;同时,转录因子结合位点的组织规则(即motif语法)如何影响染色质可及性,以及遗传变异如何通过破坏这些规则导致疾病,仍不清楚。
本文要回答: 构建人类胎儿多器官单细胞多组学图谱,利用深度学习模型解码调控motif的语法规则,并评估遗传变异对染色质可及性的影响。
技术路线
作者主要用了:SHARE-seq、ATAC-seq、RNA-seq、ChromBPNet、TF-MoDISco、Fi-NeMo、in silico marginalization。
作者首先利用SHARE-seq对12个胎儿器官的817,740个细胞进行单细胞ATAC-seq和RNA-seq联合测序,构建了人类发育多组学图谱(HDMA),注释了203种细胞类型和超过100万个候选顺式调控元件。随后,为每个细胞类型训练ChromBPNet深度学习模型,从DNA序列预测染色质可及性,并通过DeepLIFT和TF-MoDISco提取贡献分数和de novo motif,构建了508个motif的调控词典。进一步利用Fi-NeMo在基因组中鉴定motif实例,并通过in silico marginalization系统评估motif对的协同效应和语法约束。最后,将疾病相关遗传变异与motif实例重叠,预测变异对染色质可及性的影响。

图 1 Fig. 1。图1展示了HDMA数据集的整体设计和样本分布。a面板显示12个器官的样本数量分布;b面板比较了HDMA与先前胎儿单组学图谱的RNA和ATAC质量指标,显示HDMA在TSS富集、UMI数和基因数上均有提升;c面板通过热图展示203种细胞类型的标记基因表达和转录因子motif chromVAR偏差,揭示细胞类型特异性和跨器官的共性;d面板以内皮细胞为例展示不同层级的细胞注释,说明从L1到L3的聚类层次。
核心亮点
亮点 1|HDMA:多器官单细胞多组学图谱
作者利用SHARE-seq对12个人类胎儿器官的817,740个细胞进行单细胞ATAC-seq和RNA-seq联合测序,注释了203种细胞类型,并定义了1,032,273个染色质可及性顺式调控元件(caCREs),覆盖约17%的基因组。与ENCODE v4数据库相比,85.1%的HDMA caCREs与已知cCREs重叠,但脑和眼来源的元件在ENCODE中缺失较多,表明单细胞图谱能发现bulk数据遗漏的细胞类型特异性调控元件。通过ABC模型将caCREs与基因连接,发现高度连接基因(HLGs)富集细胞类型特异性过程和转录因子结合活性,其中81个全局HLGs(gHLGs)在发育中普遍受到高度调控。

图 2 Fig. 2。图2聚焦于高度连接基因(HLGs)和VISTA增强子验证。a面板显示各L3细胞簇中HLGs富集的GO生物学过程,突出细胞类型特异性功能;b和d面板分别展示内皮细胞和全局HLGs中ABC连接最多的caCREs,c和e面板显示这些HLGs富集的GO分子功能,主要为转录因子结合活性;f面板显示HDMA caCREs与VISTA增强子重叠区域的ATAC信号富集,g面板展示mm101等候选增强子的X-gal染色验证,h面板显示mm101在肝脏红细胞中的特异可及性和HBA2表达。
亮点 2|VISTA验证揭示肝脏增强子活性
作者利用VISTA数据库中的小鼠胚胎增强子活性数据验证HDMA caCREs。对于在脑、心脏和眼睛中注释为活跃的VISTA增强子,HDMA中对应器官的细胞类型表现出显著的可及性和基因表达富集(例如,脑可及性富集P=10^-437,AUROC=0.72)。有趣的是,一些先前注释为心脏特异性的增强子在HDMA中仅在肝脏细胞类型中显示强可及性。通过组织切片和X-gal染色,作者确认了6个候选增强子(如mm101)在肝脏中具有活性,其中mm101与α-珠蛋白超增强子重叠,其活性特异于肝脏红细胞,与胎儿肝脏的造血功能一致。

图 3 Fig. 3。图3概述了深度学习模型训练和motif发现流程。a面板展示从DNA序列预测染色质可及性、提取贡献分数、聚类motif并注释实例的工作流;b和c面板显示模型性能(中位Pearson r=0.78);d面板展示de novo motif与已知数据库的匹配情况,包括base、base with flanks和composite等类别;e面板展示motif的基因组分布特征,如启动子主导的motif(NRF1、NFY等)和细胞类型特异性motif(SPI、RUNX等)的TSS距离和核小体定位差异。
亮点 3|深度学习构建调控motif词典
作者为189种细胞类型训练了ChromBPNet模型(共945个模型),预测染色质可及性,中位Pearson相关系数为0.78。通过DeepLIFT和TF-MoDISco,从模型中提取了508个de novo motif,其中97%具有正贡献(促进可及性),3%具有负贡献(抑制可及性)。这些motif包括已知转录因子家族(如CTCF、GATA、HNF4)以及复合motif(同型或异型二聚体)。利用Fi-NeMo在每种细胞类型的可及性峰中鉴定motif实例,平均每个细胞类型有839,544个实例,65%位于峰summit附近150 bp内。分析显示,启动子主导的motif(如NRF1、NFY、YY1/2)普遍存在且TSS近端,而细胞类型特异性motif(如SPI、RUNX、POU、HNF4)多位于远端或内含子区域。

图 4 Fig. 4。图4展示了motif协同性和语法约束的分析。a面板显示motif方向和排列的示意图;b面板展示in silico marginalization的工作流程;c-g面板以一个E-box和homeodomain复合motif为例,展示不同间距下的预测可及性、贡献分数和协同效应量化,显示在5 bp时出现强协同;h-k面板总结所有复合motif的协同性分类,硬语法motif在特定间距(7 bp和11 bp)出现效应峰值,软语法motif效应随距离逐渐衰减;l和m面板展示协同效应的细胞类型特异性,如IKZF-RUNX在免疫细胞、FOX-HNF4在肝细胞中的特异作用。
亮点 4|硬语法与软语法协同调控
作者通过in silico marginalization系统评估了138个de novo复合motif的协同效应和语法约束。发现67个复合motif具有显著协同性,其中48个表现出硬语法(对motif间距和方向有严格偏好),27个表现出软语法(允许灵活的motif排列)。硬语法motif的最佳间距通常为7 bp或11 bp,与蛋白质结合在相邻或螺旋周期偏移的DNA沟槽一致。例如,一个E-box和homeodomain的复合motif在5 bp头尾排列时表现出强协同性,与Coordinator复合物的已知结合几何结构完全匹配。软语法motif的协同效应在20-150 bp范围内逐渐衰减。此外,协同效应具有细胞类型特异性,例如IKZF-RUNX复合motif仅在胸腺和脾脏来源的免疫细胞中驱动可及性,与相应转录因子的表达模式一致。

图 5 Fig. 5。图5展示了负向motif的特征和功能。a面板以MYOD1位点为例展示负向ZEB/SNAIL motif的贡献分数;b面板显示各器官中正向和负向motif实例的比例,负向motif在某些器官中占三分之一以上;c面板展示负向motif的CWM及其与已知数据库的匹配;d面板显示负向motif实例在核小体dyad附近富集,而正向motif在峰summit附近富集;e和f面板展示eQTL变异在正向和负向motif中的富集模式,破坏正向motif的变异与基因表达下调相关,破坏负向motif的变异与基因表达上调相关。
亮点 5|负向motif抑制染色质可及性
作者鉴定出15个具有负贡献的de novo motif,它们广泛存在于可及性区域中,平均每个峰有2-5个实例,在某些器官中占所有预测motif实例的三分之一以上。这些负向motif包括已知的转录抑制因子家族(如ZEB/SNAIL、HIC、BCL11A),以及NFY和YY1/2的特定变体(它们同时具有正向和负向作用)。负向motif实例在核小体dyad附近富集,在峰summit附近减少,与正向motif的分布相反。通过in silico消融实验,作者证实消融正向motif会降低预测可及性,而消融负向motif会略微增加可及性。此外,eQTL分析显示,破坏正向motif的变异与基因表达下调相关(P=9.91×10^-11),而破坏负向motif的变异与基因表达上调相关(P=8.01×10^-4),支持负向motif在调控中的功能作用。
亮点 6|疾病变异影响发育调控元件
作者利用g-chromVAR分析发现,131种胎儿细胞类型对疾病相关遗传变异显著富集(FDR<0.05),且富集模式具有细胞类型特异性但跨器官保守。例如,免疫细胞富集甲状腺疾病、皮炎和湿疹等变异,肌细胞富集房颤变异,内皮细胞富集高血压变异。进一步,作者筛选出28个仅在胎儿细胞类型中可及的高置信因果变异(SuSiE PIP≥0.8),并利用ChromBPNet模型预测其效应。例如,哮喘相关变异rs113892147破坏了胎儿肺巨噬细胞中的NRF1 motif,预测降低染色质可及性;冠心病相关变异rs12740374破坏了胎儿肌肉内皮细胞中的负向ZEB/SNAIL motif并创建C/EBP结合位点,预测增加可及性。这些结果表明,发育阶段的调控元件可能在疾病易感性中发挥作用。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: SHARE-seq、ATAC-seq、RNA-seq、ChromBPNet、TF-MoDISco、Fi-NeMo、in silico marginalization
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事单细胞多组学、基因调控或遗传变异功能解读的研究者。
带走一句
深度学习模型不仅能从序列预测染色质可及性,还能系统解析转录因子协同作用的语法规则,为解读非编码变异提供新范式。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。