周启涛生物技术工作室
多组学与方法2025/06/16· 编译自 Nature Methods

IF36.1|CondenSeq高通量解析核凝聚体蛋白序列决定因素

大规模池化成像结合原位测序,系统揭示芳香族残基与净电荷驱动核凝聚体形成。

大规模池化成像结合原位测序,系统揭示芳香族残基与净电荷驱动核凝聚体形成。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

生物分子凝聚体是细胞内无膜的功能区室,参与基因调控、RNA加工等关键过程,并与神经退行性疾病和癌症相关。许多凝聚体由固有无序区(IDR)驱动形成,但并非所有IDR都能形成凝聚体。此前研究已发现芳香族、疏水性、极性、带电氨基酸及其排列模式均可影响凝聚体形成,但多基于单一模型蛋白,结论的普适性未知。此外,凝聚体形成具有浓度依赖性和环境敏感性,不同实验条件间难以比较。因此,亟需一种高通量方法,在一致的细胞环境中系统评估大量蛋白序列的凝聚体形成倾向。

科学问题

卡在哪里: 现有方法难以规模化:计算预测不够可靠,体外实验不能完全反映细胞内行为,而传统荧光成像受限于阵列式操作,通量低。因此,缺乏在统一生物学条件下对数千个蛋白序列进行系统比较的手段,导致序列特征对凝聚体形成的影响在不同序列背景中的一致性未知。

本文要回答: 开发CondenSeq高通量方法,系统评估数千个蛋白序列在细胞核内形成凝聚体的倾向,并解析驱动凝聚体形成的序列特征及其在不同背景中的一致性。

技术路线

作者主要用了:高通量池化成像、原位测序、慢病毒文库、活细胞成像、自监督深度学习

作者开发了CondenSeq,将数千个编码不同蛋白序列的DNA寡核苷酸池克隆到慢病毒载体中,融合荧光蛋白和核定位信号,并可选加寡聚化结构域以调节价态。细胞以低MOI转导后,进行活细胞共聚焦成像,检测核和凝聚体。随后固定细胞,通过原位合成测序读取条形码,将每个细胞与其表达的蛋白序列关联。最后自动分析图像,提取凝聚体特征和蛋白浓度。该方法可在一个样本中检测约5000个序列,远超传统方法。

Fig. 1. · 原文图,按文末许可署名使用
Fig. 1. · 原文图,按文末许可署名使用

图 1 Fig. 1.。图1展示了CondenSeq的整体流程:从DNA寡核苷酸池合成、克隆到慢病毒载体、低MOI转导细胞、活细胞成像(Hoechst和GFP/SNAP通道)到原位测序读取条形码。示例图像中箭头指示有或无凝聚体的细胞。该方法的关键优势在于高通量,可在单个样本中检测数千个序列,并通过原位测序将表型与序列关联。

核心亮点

亮点 1|净电荷与芳香族残基促进凝聚体形成

对天然蛋白片段库的分析显示,净电荷每残基(NCPR)与凝聚体形成分数(fcondensates)呈正相关,且在不同寡聚化结构域下均成立。大规模突变实验进一步表明,添加或去除精氨酸、赖氨酸和芳香族氨基酸(Y、F、W)对凝聚体形成影响最大,其中添加色氨酸的促进作用最强。负电荷残基(D、E)则降低凝聚体形成。这些效应在多种序列背景下高度一致,表明带电和芳香族残基是驱动核凝聚体形成的关键因素。

Fig. 2. · 原文图,按文末许可署名使用
Fig. 2. · 原文图,按文末许可署名使用

图 2 Fig. 2.。图2展示了天然蛋白片段库的组成和序列相似性。左图为氨基酸组成相关性直方图,显示序列间氨基酸组成差异较大;右图为序列同一性百分比直方图,表明序列间相似性低。此外,实验重复性分析显示GFP亚库中不同条形码标记的相同序列结果高度一致,验证了方法的可靠性。

亮点 2|氨基酸排列模式影响凝聚体形成

通过设计模式变异序列集,作者发现带电残基的排列模式显著影响凝聚体形成。例如,将带电残基均匀分布与聚集分布相比,均匀分布更有利于凝聚体形成。对特定序列的扰乱实验显示,改变带电残基的排列可改变凝聚体形成倾向。然而,与氨基酸组成相比,排列模式的影响在不同序列背景中一致性较低,表明其作用更具上下文依赖性。

Fig. 3. · 原文图,按文末许可署名使用
Fig. 3. · 原文图,按文末许可署名使用

图 3 Fig. 3.。图3展示了大规模突变实验的结果。A部分显示基础序列的fcondensates分布。C部分显示突变体与基础序列相比fcondensates的变化,点的大小表示突变数量,颜色表示突变体的fcondensates。小提琴图展示了针对特定氨基酸的突变效应,显示添加或去除带电和芳香族残基对凝聚体形成影响最大。D部分为归一化后的单氨基酸替换效应,进一步证实色氨酸添加的促进作用最强。E部分显示NCPR和芳香族残基数量对凝聚体形成的联合影响,表明两者可相互补偿。

亮点 3|不同凝聚体类型具有独特序列特征

利用自监督深度学习模型提取图像特征,结合SVM分类器,作者识别出定位于核仁或染色质的凝聚体。这些序列相比其他凝聚体形成序列,具有更高的NCPR、带电残基比例和精氨酸/赖氨酸含量,但芳香族残基比例较低。此外,具有浓度缓冲能力的序列(即稀释相浓度不随总浓度增加而升高)富含芳香族残基,且芳香族残基分布更均匀。这些结果表明,不同理化特征驱动不同类型凝聚体的形成。

Fig. 4. · 原文图,按文末许可署名使用
Fig. 4. · 原文图,按文末许可署名使用

图 4 Fig. 4.。图4展示了基于图像的凝聚体分类。A部分为核仁和染色质定位分类器的示意图。B部分为分类为核仁或染色质定位的示例图像。C和D部分比较了不同类别序列的特征,显示核仁和染色质定位序列具有更高的NCPR和带电残基比例,但芳香族残基比例较低。E-G部分展示了浓度缓冲能力的分析,H部分显示浓度缓冲序列富含芳香族残基且分布更均匀。

亮点 4|同型与异型相互作用预测揭示机制差异

利用FINCHES预测测试蛋白与人类IDR之间的相互作用,作者发现核仁和染色质定位序列的异型相互作用倾向显著高于其他凝聚体形成序列,而浓度缓冲序列则更倾向于同型相互作用。进一步分析显示,同型相互作用主导的序列具有更低的NCPR和更高的芳香族残基比例。这表明高NCPR可能通过异型相互作用促进凝聚体形成,而芳香族残基则更依赖于同型相互作用。

Fig. 5. · 原文图,按文末许可署名使用
Fig. 5. · 原文图,按文末许可署名使用

图 5 Fig. 5.。图5展示了基于FINCHES预测的分子间化学特异性分析。A部分为FINCHES预测流程。B部分为测试蛋白与人类IDR相互作用参数的聚类热图,分为10个簇。C部分比较了各簇内凝聚体形成与非形成序列的特征差异,显示少数特征在不同簇中呈现相反趋势。D-E部分显示同型与异型相互作用倾向的分布,核仁和染色质定位序列更倾向于异型相互作用,而浓度缓冲序列更倾向于同型相互作用。F部分显示同型与异型相互作用主导序列之间的特征差异。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 高通量池化成像、原位测序、慢病毒文库、活细胞成像、自监督深度学习
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事生物分子凝聚体、蛋白质序列功能或高通量成像技术研究的科研人员。

带走一句

CondenSeq提供了一种可扩展的框架,在统一细胞环境中系统解析蛋白序列与凝聚体形成的关系,为构建预测模型和指导实验设计提供了大规模数据集。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。