IF50.5|大规模并行解析转录调控元件
68万个候选调控元件在三种细胞中的活性图谱,揭示启动子与增强子的核心差异。
68万个候选调控元件在三种细胞中的活性图谱,揭示启动子与增强子的核心差异。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
人类基因组中数百万候选顺式调控元件(cCREs)以细胞类型特异性方式调控基因表达,与健康和疾病密切相关。然而,我们对控制这些元件活性和细胞类型特异性的序列特征缺乏功能性理解。此前,ENCODE等计划通过染色质开放性、转录因子结合、组蛋白修饰等生化特征在数百种细胞类型中注释了数百万cCREs,但这些方法多为描述性,无法直接证明元件是否具有功能。大规模并行报告基因检测(MPRA)可同时测试数千个序列的调控活性,但传统方法依赖瞬时转染,提供游离型读数,且局限于易转染的细胞系。慢病毒MPRA(lentiMPRA)通过随机整合到基因组,提供“基因组内”读数,与ENCODE注释和序列模型相关性更高,但此前受限于单次实验可测试的序列数量。
科学问题
卡在哪里: 此前lentiMPRA单次实验可测试的序列数量有限,难以覆盖一个细胞类型中大部分cCREs。同时,缺乏对启动子和增强子在方向依赖性、细胞类型特异性及序列决定因素方面的系统性功能比较。此外,基于序列的深度学习模型在预测调控活性和变异效应方面的性能仍有提升空间。
本文要回答: 本文旨在利用优化的lentiMPRA技术,在三种细胞系中大规模测试超过68万个cCREs的调控活性,系统比较启动子与增强子的方向依赖性和细胞类型特异性,并开发高精度的序列模型以预测调控活性和变异效应。
技术路线
作者主要用了:lentiMPRA、RNA-seq、CRISPRi、DNase-seq、ATAC-seq、ChIP-seq、深度学习。
作者首先优化lentiMPRA方案,通过添加随机条形码和最小启动子,实现单次实验测试超过20万个序列。利用DNase超敏位点作为候选增强子的主要选择标准,设计并测试了HepG2、K562和WTC11三种细胞系的大规模文库,包括所有蛋白编码基因启动子和大量潜在增强子,并在正反两个方向进行测试。此外,设计了一个包含6万个共同元件的联合文库,在三种细胞中同时测试,以直接评估细胞类型特异性。基于这些数据,训练了多种序列模型(如MPRALegNet)和生化模型,用于预测调控活性和变异效应,并通过饱和突变和等位基因特异性数据验证模型性能。

图 1 Fig. 1。图1展示了lentiMPRA策略及文库组成。a部分显示将数千个cCRE(包括潜在增强子和启动子)以正反两个方向插入报告质粒,并与条形码相连,通过慢病毒感染细胞后测序DNA和RNA条形码来定量活性。b部分显示三个细胞系文库的组成,包括潜在增强子、启动子、阴性对照和阳性对照的数量。
核心亮点
亮点 1|41.7%的cCREs具有调控活性
在HepG2、K562和WTC11三种细胞中,利用lentiMPRA测试了超过680,000个序列,包括所有已知蛋白编码基因启动子和大量潜在增强子。以二核苷酸洗牌序列为阴性对照,发现41.7%的序列具有显著调控活性。其中,超过50%的启动子序列有活性(HepG2: 54.6%,K562: 52.3%,WTC11: 50.6%),而潜在增强子的活性比例在25.8%至42.8%之间。这些数据提供了迄今最大规模的功能性cCRE目录,为后续分析奠定了基础。

图 2 Fig. 2。图2展示了启动子和增强子的方向依赖性。a部分显示同一方向的重复间相关性高于相反方向。b部分显示正向和反向活性的散点图,大部分元件活性相近但存在方向偏差。c部分显示启动子的链不对称性略强于增强子。d部分显示启动子活性与内源基因表达的相关性,正义方向高于反义方向。e部分显示200 bp核心启动子活性与内源表达的相关性。f和g部分展示与高活性启动子和增强子相关的转录因子基序。
亮点 2|启动子与增强子的方向依赖性差异
通过测试同一元件在正反两个方向的活性,发现启动子比增强子表现出更强的链方向不对称性。在所有细胞类型中,同一方向的重复间相关性比相反方向高约0.2。启动子的方向不对称性更强,表明其可能包含单向促进转录的转录因子结合位点。此外,200 bp的核心启动子区域足以重现内源基因表达水平(Pearson r≈0.55),并且启动子活性在不同细胞类型间相关性高(平均r=0.82),而增强子则表现出更强的细胞类型特异性(r=0.32-0.65)。

图 3 Fig. 3。图3展示了MPRALegNet模型的性能和解释。a部分为模型架构。b部分显示序列模型优于生化模型,MPRALegNet在多数细胞类型中表现最佳。c部分显示模型预测与实验观测的散点图,相关性约0.83。d部分展示细胞类型特异性和通用转录因子基序。e-h部分展示模型对同型和异型转录因子结合位点组合效应的预测能力。
亮点 3|MPRALegNet模型高精度预测调控活性
基于LegNet架构的深度学习模型MPRALegNet在预测cCRE活性方面优于生化模型和其他序列模型(如MPRAnn、EnformerMPRA、SeiMPRA),在三个细胞类型中的Pearson相关系数约为0.83,接近实验重复间的技术噪声水平。通过in silico突变和TF-MoDISco-lite分析,模型识别出许多通用和细胞类型特异性的转录因子基序,如KLF、ETS、CTCF在所有细胞中富集,而HNF4A/G在HepG2、GATA-TAL1在K562、POU5F1-SOX2在WTC11中特异性富集。模型还能准确预测同型和异型转录因子结合位点的组合效应,包括超乘性和亚乘性相互作用。

图 4 Fig. 4。图4展示了模型在变异效应预测方面的验证。a部分显示模型预测与等位基因特异性染色质可及性和转录因子结合数据的一致性,蓝色为一致,红色为不一致,灰色为不确定。b部分展示对PKLR启动子饱和突变数据的预测与实验观测的比较,模型能识别出GATA3、KLF9等关键基序。
亮点 4|模型可预测调控变异效应
MPRALegNet能够预测单核苷酸变异对调控活性的影响。在K562和HepG2细胞中,模型预测的变异效应与等位基因特异性染色质可及性(ATAC-seq、DNase-seq)和转录因子结合(ChIP-seq)数据显著一致(Fisher精确检验OR>1.5,P<0.05)。此外,对先前饱和突变MPRA数据(SORT1、PKLR、LDLR、F9)的预测与实验观测的相关性在0.49-0.66之间,与Enformer性能相当。这表明模型可用于遗传精细定位和变异效应预测。

图 5 Fig. 5。图5展示了联合文库分析细胞类型特异性。a部分显示联合文库的组成。b部分显示在K562中缺乏DNase信号的元件仍可能具有活性。c部分主成分分析显示增强子和阳性对照在来源细胞类型中具有更强的相对活性。d部分显示特异性评分的分布。e部分显示多任务MPRALegNet和EnformerMPRA在预测特异性评分方面的性能。
亮点 5|细胞类型特异性由少数TFBS驱动
通过联合文库在三种细胞中测试60,000个共同元件,发现启动子的活性在不同细胞间高度相关(平均r=0.82),而增强子则表现出明显的细胞类型特异性。主成分分析显示,去除代表通用活性的第一主成分后,增强子和阳性对照在来源细胞类型中表现出更强的相对活性。通过TF-MoDISco-lite识别出21个HepG2和K562特异性基序以及12个WTC11特异性基序,这些基序对应的转录因子在相应细胞中高表达。此外,DNase信号并非活性的绝对前提,15-25%缺乏DNase信号的元件仍具有活性。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: lentiMPRA、RNA-seq、CRISPRi、DNase-seq、ATAC-seq、ChIP-seq、深度学习
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事基因调控、功能基因组学、深度学习模型开发的研究人员。
带走一句
大规模lentiMPRA数据结合深度学习模型,可高效解析调控元件活性和变异效应,为功能基因组学提供强大资源。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。