周启涛生物技术工作室
基因组与遗传2024/09/16· 编译自 Nature Genetics

IF31.7|系统解析结直肠癌风险位点的功能变异与靶基因

整合多组学与高通量报告基因实验,为170个CRC风险位点锁定候选因果变异和208个靶基因。

整合多组学与高通量报告基因实验,为170个CRC风险位点锁定候选因果变异和208个靶基因。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

结直肠癌(CRC)是全球高发癌症,遗传度较高。大规模GWAS已鉴定出超过200个显著风险位点,但绝大多数位点的功能变异和靶基因仍不清楚。由于连锁不平衡和变异多位于非编码区,传统计算精细定位只能基于LD推测,难以确定因果变异。非编码变异通常通过顺式调控影响基因表达,因此需要结合表观遗传注释、染色质可及性、三维染色质互作和基因表达数据来系统解读。此前研究多依赖单一数据类型,或仅将变异分配给最近基因,可靠性有限。

科学问题

卡在哪里: 尽管已有精细定位和功能注释方法,但大多数CRC风险位点的因果变异仍未被实验验证,靶基因也缺乏可靠预测。已发表的eQTL仅能解释癌症GWAS遗传力的9–13%,且单纯依赖物理距离分配基因不可靠。此外,增强子可调控多个基因,传统方法难以全面捕获。

本文要回答: 本文旨在系统性地为170个CRC风险位点优先排序功能变异,并通过整合多组学数据将变异与靶基因联系起来,揭示CRC易感性的分子基础。

技术路线

作者主要用了:MPRA、ATAC-seq、ChIP-seq、RNA-seq、Micro-C、scRNA-seq、eQTL、SMR、ABC模型

作者首先利用scRNA-seq和表观遗传数据确定CRC风险位点主要活跃于结肠上皮细胞。然后对每个位点进行统计精细定位(PolyFun+SuSiE),并在多个结肠细胞系中开展MPRA实验,检测变异对转录活性的影响。接着整合MPRA、精细定位、染色质状态、ATAC-seq、CTCF结合、Micro-C互作和Akita预测等注释,对每个变异打分并分层。最后结合eQTL、SMR和ABC模型将优先变异与靶基因关联,并通过文献挖掘和药物数据库评估靶基因的临床潜力。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了整体分析流程:从CRC GWAS的170个风险位点出发,整合MPRA、表观遗传标记(ChIP-seq)、染色质可及性(ATAC-seq)、基因表达(RNA-seq)和长程染色质互作(Micro-C)数据,计算整合评分以优先排序功能变异,并通过结肠特异性eQTL和SMR将变异与靶基因关联。图中GWAS曼哈顿图上的彩色点表示超过显著性阈值的变异,SMR图显示GWAS与eQTL数据的整合结果。

核心亮点

亮点 1|MPRA实验鉴定275个功能性变异

作者在HT29、SW403和HCEC-1CT三个细胞系中对8,880个变异进行了大规模平行报告基因实验(MPRA),以FDR<10^-3为阈值,共鉴定出275个具有显著等位基因转录活性差异的变异。这些MPRA显著变异更可能被精细定位为因果变异(P=4.39×10^-3),且显著富集于结肠表观基因组的增强子和启动子区域(P=3.66×10^-18)。此外,它们优先定位于开放染色质(P=7.32×10^-35),并倾向于通过Micro-C染色质互作与基因转录起始位点(TSS)相连(P=7.28×10^-4)。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2展示了各风险位点的变异评分分布。每个位点以细胞遗传学条带和top GWAS SNP标记。变异根据注释得分总和排序,得分前20%为Tier 1,后50%为Tier 3,其余为Tier 2。图中可见不同位点的Tier 1变异数量差异较大,部分位点缺乏高评分变异,反映了功能数据的覆盖不均。

亮点 2|整合评分系统优先排序因果变异

作者将MPRA、精细定位PIP、染色质状态、ATAC-seq、CTCF结合、Micro-C互作、SMR和Akita预测等注释整合为一个评分系统,每个变异根据证据强度获得0–2分。按总分排序,前20%定义为Tier 1变异,后50%为Tier 3,其余为Tier 2。共鉴定出2,406个Tier 1变异,其中42个也是GWAS的top hit。49个位点没有Tier 1变异,16个位点甚至没有任何Tier 2变异,这些区域缺乏功能数据。该评分系统为每个位点提供了候选因果变异的优先列表。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3展示了三个代表性位点的详细解析。a:8q24.21位点,rs6983267和rs7013278相距1.5kb,但rs6983267具有更强的MPRA、转录因子结合、ATAC-seq和Micro-C证据,而rs4733767距离超过150kb,注释独立,可能是真正的独立信号。b:10p12.1位点,rs1248418(与lead SNP rs1773860连锁)位于增强子区域,通过长程互作调控BAMBI。c:1p34.3位点,rs67631072通过SMR和Micro-C证据关联FHL3。

亮点 3|208个靶基因与TGFβ通路富集

通过整合eQTL、SMR、ABC模型和Micro-C数据,作者将Tier 1变异与208个靶基因关联。其中94个位点由至少两种证据支持,10个位点仅有一种证据。约70%的变异与靶基因位于同一拓扑关联域(TAD)。通路富集分析显示靶基因显著富集于TGFβ信号通路(KEGG Padj=4.31×10^-6)、Hippo通路(Padj=6.50×10^-5)和Wnt通路(Padj=9.38×10^-3)。例如,rs1248418通过长程互作调控BAMBI(TGFβ负调控因子),rs67631072影响FHL3表达,后者与SMAD2/3/4互作,进一步强调TGFβ通路在CRC遗传易感性中的核心作用。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4将整合分析鉴定的基因按生物学或细胞功能分类。方框大小与类别中基因数量成正比。图中显示靶基因涉及多种功能类别,包括信号转导、转录调控、细胞周期等,其中TGFβ、Wnt等通路相关基因占比较大,提示这些通路在CRC遗传易感性中的重要性。

亮点 4|新靶基因与药物再利用机会

在208个靶基因中,142个在文献中无CRC相关报道,47个在任何癌症中均无已知作用。通过oncoEnrichR分析,10个基因已有获批药物可用于再利用,如crofelemer(靶向ANO1)和misoprostol(靶向PTGER3)。此外,44个基因具有临床或发现阶段药物,31个可能具有可成药性。基于CRISPR筛选数据,TBCD、KLF5和SOX9被预测为CRC有前景的治疗靶点。这些发现为CRC预防和治疗提供了新的潜在药物靶点。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: MPRA、ATAC-seq、ChIP-seq、RNA-seq、Micro-C、scRNA-seq、eQTL、SMR、ABC模型
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事癌症遗传学、功能基因组学或药物靶点发现的研究者。

带走一句

多组学整合与高通量MPRA结合,能系统破解GWAS风险位点,为复杂疾病遗传解析提供可复用的策略。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。