IF50.5|DNA引导的转录因子互作扩展人类基因调控密码
CAP-SELEX大规模筛选揭示TF-TF-DNA三元复合体的互作图谱,发现大量新型复合基序与间距偏好。
CAP-SELEX大规模筛选揭示TF-TF-DNA三元复合体的互作图谱,发现大量新型复合基序与间距偏好。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
转录因子(TF)通过识别特定DNA序列调控基因表达,其结合特异性构成了基因调控密码的基础。人类基因组编码超过1,600个TF,它们常以协同方式结合DNA,形成TF-TF-DNA复合体,从而整合位置信息、决定细胞命运。此前研究已发现一些重要的协同结合实例,如POU5F1-SOX2维持胚胎干细胞多能性,但全基因组范围内DNA依赖的TF互作图谱仍不完整。CAP-SELEX方法可在体外同时鉴定单个TF的结合偏好、TF-TF互作以及复合体结合的DNA序列,为系统绘制TF-TF互作图谱提供了可能。
科学问题
卡在哪里: 此前CAP-SELEX仅覆盖9,400对TF,发现618个TF-TF配对基序,远未穷尽人类TF组中超过130万种可能的TF-TF组合。此外,现有结构预测工具对DNA依赖的TF-TF复合体预测能力有限,且TF-TF互作基序在体内功能与进化保守性缺乏系统评估。
本文要回答: 本文旨在通过高通量CAP-SELEX系统绘制人类TF-TF-DNA互作图谱,鉴定新型复合基序与间距/方向偏好,并评估其体内活性、进化保守性及在发育中的潜在作用。
技术路线
作者主要用了:CAP-SELEX、HT-SELEX、mixture-SELEX、ChIP-seq、单细胞ATAC-seq、AlphaFold/RoseTTAFold2NA。
作者将CAP-SELEX流程改进为384孔板高通量格式,表达并纯化了158个SBP标签的bait TF和419个His标签的prey TF,组合成58,754对TF进行筛选。通过三轮亲和纯化富集协同结合的DNA配体,测序后开发了基于互信息的算法检测间距/方向偏好,以及基于相对亲和力的算法检测新型复合基序。同时利用HT-SELEX获得单个TF的结合特异性作为参照,并通过ChIP-seq、单细胞ATAC-seq、转基因报告实验和结构预测工具对发现的互作进行体内验证和功能解析。

图 1 Fig. 1。图1展示了CAP-SELEX的高通量流程(a),以及本研究覆盖的TF结构家族分布(b),并与先前研究比较。关键结果是:通过384孔板自动化,筛选规模从9,400对扩展到58,754对,覆盖所有主要TF家族。图1c显示互作TF对倾向于短间距(≤5 bp),且不同家族成员对间距有特异性偏好。图1d的circos图揭示TF-TF互作常跨家族发生,如TEA家族非常混杂,而C2H2锌指蛋白互作较少。
核心亮点
亮点 1|大规模筛选发现2,198对互作TF
对超过58,000对TF进行CAP-SELEX筛选,共鉴定出2,198对具有特异性互作的TF,其中1,329对表现出对基序间距和方向的偏好,1,131对形成与单个TF基序明显不同的复合基序。通过子采样分析估计,该筛选覆盖了人类TF-TF复合基序的18%至47%。互作分析显示,TF-TF互作常跨结构家族发生,且短间距(≤5 bp)更为普遍,但不同家族成员对间距的偏好具有特异性。

图 2 Fig. 2。图2聚焦复合基序的特异性。图2a显示近一半复合基序在旁系同源组或亚家族内特异,其余跨更广泛的结构家族。图2b展示PITX与FOXA/FOXD亚家族、HOXA2/HOXB2与PROX亚家族的特异性复合基序,并与单体基序比对。图2c以FOXK2-ELF1为例,显示其复合基序与单体基序差异显著,但在FOXK2和ELF1的ChIP-seq重叠峰中高度富集,证明该新型基序在体内被TF对结合。
亮点 2|复合基序与单体基序显著不同
通过Jaccard指数和Jensen-Shannon散度分析发现,复合基序的中心重叠区域有89%(Jaccard)和56%(JSD)与至少一个单体TF的偏好序列不同,54%和24%与两个单体均不同。例如ELF1-FOXK2复合基序与两个单体基序差异显著,但在ELF1和FOXK2的ChIP-seq重叠峰中高度富集,表明这种新型基序在体内被TF对结合。此外,42/93例复合基序在重叠ChIP-seq峰中比单独峰更富集(P<0.012)。

图 3 Fig. 3。图3分析先锋因子和发育TF的互作。图3a显示先锋因子在互作伙伴数量上差异很大,但整体上并不比其他TF更具特异性。图3b展示在脊髓背腹轴模式中,几乎所有特定细胞类型都有对应的TF-TF复合基序。图3c显示具有强激活域的TF(如TCF4、ATOH1、SRF、HOXB2)与171个其他TF互作。图3d-e通过转基因报告实验证明HOXA2-PROX2和GLI3-RFX3复合基序在E11.5小鼠胚胎中驱动特异性表达,且HOXA2-PROX2基序存在于Prox1自身增强子上。
亮点 3|先锋因子与发育TF的互作特异性
分析已知先锋因子发现,它们在选择互作伙伴上差异很大:FOXA1和SOX11具有许多伙伴,而GATA3、GATA4、CEBPs、PAX6/7等则更具选择性。整体上先锋因子并不比其他TF具有更多特异性互作。在神经管背腹轴模式中,几乎所有特定细胞类型都有对应的TF-TF对结合复合基序。例如HOX5与OLIG2形成高度旁系同源特异的互作,HOXA2/HOXB2与PROX1/2特异性互作。

图 4 Fig. 4。图4评估结构预测工具的性能。图4a显示AlphaFold2能准确预测预形成二聚体(如MYC-MAX),但无法预测DNA依赖的二聚体(如MEIS1-DLX3)。图4b总结AlphaFold3和RoseTTAFold2NA在预测TF-DNA复合体整体几何结构上有所改善,但在预测TF对结合DNA的哪一侧以及间距/方向上仍接近随机水平。图4c展示作者解析的6个新晶体结构,揭示现有工具无法正确预测关键接触残基,如FOXK1-ELF1、MEIS1-HOXB13和DLX3-MEIS1复合体中的互作。
亮点 4|复合基序驱动体内特异性表达
利用转基因增强子-报告基因实验,在小鼠E11.5胚胎中测试了6个复合基序的活性。HOXA2-PROX2基序在顶端外胚层脊、前脑、中脑、后脑、面部间充质和耳泡中驱动LacZ强表达;GLI3-RFX3复合基序在腹侧中脑、神经管、前脑和肢芽的极性活化区(ZPA)驱动表达,与Shh表达区域一致(10/11胚胎)。而仅含GLI或RFX基序的报告基因无活性,表明复合基序对于特异性表达是必要的。

图 5 Fig. 5。图5展示TF-TF互作基序的生物学相关性。图5a显示在人类细胞图谱中共表达的TF形成复合基序的频率显著高于随机配对(P<6×10^-14)。图5b以肢体发育为例,展示共表达的TF(如HOXD13、TBX5等)形成特异性复合基序。图5c显示bHLH-同源域TF对的间距基序在特定细胞类型cCRE中富集,如4 bp间距在基质/成纤维细胞中富集,3 bp在胰腺β细胞中富集。图5d通过逻辑回归分析表明复合基序匹配可预测细胞类型特异性元件。
亮点 5|复合基序在进化上保守且富集于细胞类型特异元件
利用Zoonomia联盟的哺乳动物保守性数据,发现165个间距/方向偏好显著保守(预期116个,P<5×10^-6),81个复合基序的匹配序列比对照基序更保守(FWER<0.05)。在人类细胞图谱的共表达分析中,共表达的TF形成复合基序的频率显著高于随机配对(P<6×10^-14)。在CATlas单细胞ATAC-seq数据中,211/347个代表性复合基序和74/112个代表性间距基序在至少一个细胞类型特异性cCRE集中富集(log2FC>0.75,P<0.01)。
亮点 6|结构预测工具难以捕捉DNA依赖的TF-TF互作
使用AlphaFold2、AlphaFold3和RoseTTAFold2NA对TF-TF-DNA复合体进行结构预测。AlphaFold2能准确预测预形成二聚体(如MYC-MAX,r.m.s.d. 0.428 Å),但无法预测DNA依赖的二聚体(如MEIS1-DLX3)。AlphaFold3和RoseTTAFold2NA在预测整体几何结构上有所改善,但在预测TF对结合DNA的哪一侧以及精确的间距和方向上仍接近随机水平(概率≈0.5)。作者解析了6个新的TF-TF-DNA晶体结构,发现现有工具无法正确预测关键接触残基。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: CAP-SELEX、HT-SELEX、mixture-SELEX、ChIP-seq、单细胞ATAC-seq、AlphaFold/RoseTTAFold2NA
- 公开数据: PRJEB66722
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事转录调控、发育生物学、增强子分析或结构生物信息学的研究者。
带走一句
做TF调控分析时,不要只看单个TF的基序;考虑TF-TF复合基序和间距偏好,能解释更多细胞类型特异性的调控元件。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。