IF36.1|GlycoShape:秒级恢复糖蛋白天然构象的糖基化工具箱
基于1毫秒分子动力学采样,GlycoShape数据库与Re-Glyco算法可快速重建糖蛋白结构,N-糖基化位点预测准确率达93%。
基于1毫秒分子动力学采样,GlycoShape数据库与Re-Glyco算法可快速重建糖蛋白结构,N-糖基化位点预测准确率达93%。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
蛋白质的翻译后修饰(PTM)对结构和功能至关重要,其中糖基化是最丰富也最神秘的修饰之一。糖基化通过共价连接聚糖到蛋白质的Ser/Thr(O-糖基化)或Asn(N-糖基化)侧链,影响蛋白折叠、稳定性、识别和信号传导。然而,由于聚糖固有的柔性和微不均一性,实验结构解析中聚糖常常被去除或不可见,导致糖蛋白三维结构信息严重缺失。尽管冷冻电镜和X射线晶体学不断进步,但聚糖结构解析仍极具挑战。糖生物信息学数据库和高性能计算分子模拟为填补这一空白提供了可能,但现有工具在糖蛋白结构重建的效率和准确性上仍有不足。
科学问题
卡在哪里: 现有糖蛋白结构数据库和重建工具要么缺乏足够的聚糖构象采样,要么在将聚糖连接到蛋白质时无法有效处理空间位阻和构象选择,导致糖基化位点预测和结构恢复的可靠性不足。此外,缺乏一个整合了高质量聚糖三维结构库和高效对接算法的开放平台,使得研究人员难以快速获得功能状态的糖蛋白结构。
本文要回答: 开发一个开放获取的聚糖结构数据库和糖蛋白重建工具箱,利用大规模分子动力学模拟和遗传算法,实现糖蛋白结构的快速、准确恢复,并预测N-糖基化位点。
技术路线
作者主要用了:分子动力学模拟、PCA降维、高斯混合模型聚类、核密度估计、遗传算法。
作者首先通过多副本非相关分子动力学模拟对每个聚糖进行至少1.5微秒的采样,累积超过1毫秒,构建GlycoShape聚糖数据库。随后,利用图矩阵表示和PCA降维将模拟轨迹转化为三维构象景观,并用高斯混合模型聚类和核密度估计选取代表性构象。在此基础上,开发Re-Glyco算法,通过遗传算法优化聚糖与蛋白质连接处的扭转角,最小化空间位阻损失函数,从而将聚糖连接到蛋白质上。该算法还用于GlcNAc Scanning,通过测试单个GlcNAc能否无冲突地连接到N-糖基化序列子上,预测位点占用。整个流程集成在GlycoShape网站中,用户可上传或获取蛋白质结构,一键完成糖基化重建。

图 1 Fig. 1。图1展示了GlycoShape平台的整体工作流程。顶部显示GlycoShape GDB是一个聚糖三维结构库,来源于1毫秒累积采样的非相关副本确定性分子动力学模拟。用户可以通过集成SugarDrawer工具绘制SNFG符号结构或通过文本搜索(IUPAC、WURCS、SMILES、GLYCAM和GlyTouCan格式)查找聚糖。图中还展示了四天线复杂N-聚糖的GlyTouCan ID。
核心亮点
亮点 1|GlycoShape数据库覆盖人类糖组
GlycoShape聚糖数据库(GDB)包含534个独特聚糖结构,主要来源于人类糖组,并涵盖其他哺乳动物、无脊椎动物、植物、真菌和细菌的聚糖。每个聚糖通过多副本分子动力学模拟进行至少1.5微秒的采样,累计超过1毫秒,确保构象空间被充分探索。通过聚类分析,每个聚糖以多个代表性三维构象及其相对布居权重存储,用户可通过结构绘制或文本搜索(支持IUPAC、WURCS、SMILES、GLYCAM和GlyTouCan格式)获取。数据库每周新增约30个结构,持续增长。

图 2 Fig. 2。图2详细展示了Glycan Analysis Pipeline(GAP)的步骤。a:对每个聚糖进行多个非相关副本MD模拟以全面采样其结构动力学。b,c:将MD帧转换为图矩阵表示,并通过展平下三角简化为单维数组。d:通过PCA进行降维。e:使用GMM聚类,结果显示聚类分布。f:基于KDE最大值选择每个聚类的代表性三维结构,并附有全面的扭转角分布。
亮点 2|Re-Glyco算法高效重建糖蛋白
Re-Glyco利用遗传算法优化聚糖与蛋白质连接处的φ和ψ扭转角,最小化空间位阻损失函数,从而将聚糖连接到蛋白质上。算法从最高布居的聚糖构象开始尝试,若无法解决冲突则依次尝试其他构象,最后通过‘wiggle’过程微调扭转角。该算法支持N-糖基化、O-GalNAc、O-GlcNAc、O-岩藻糖基化、O-甘露糖基化、O-葡萄糖基化、O-木糖基化和C-甘露糖基化等多种类型。此外,Re-Glyco Ensemble模块可拟合多个模拟帧并计算溶剂可及表面积,评估聚糖屏蔽效应。

图 3 Fig. 3。图3展示了Re-Glyco算法中聚糖与蛋白质连接的关键参数和流程。a:定义了φ和ψ扭转角,以及对应原子标记。b:热图显示Asn-b-GlcNAc和Thr-a-GalNAc连接的φ、ψ扭转角偏好构象,能量最小值用红色矩形标出。c:四天线完全α3-唾液酸化N-聚糖的二维SNFG结构和三维结构。d:Re-Glyco工作流程示意图。
亮点 3|GlcNAc Scanning预测N-糖基化位点准确率达93%
通过GlcNAc Scanning,Re-Glyco在739个具有实验糖蛋白组学数据的PDB蛋白质结构上测试,预测N-糖基化位点的准确率达到93%。该工具通过测试单个β-GlcNAc能否无冲突地连接到N-X-S/T序列子上,输出简单的‘是’或‘否’判断。在CD16b案例中,GlcNAc Scanning正确识别了大部分位点,并通过分析假阳性和假阴性揭示了蛋白质结构本身的问题,如Asn侧链取向错误或膜环境缺失导致的位点可及性差异。

图 4 Fig. 4。图4展示了CD16b的糖基化重建案例。a:CD16b(PDB 1E4J)结构,标注了N-糖基化序列子,粗体表示中性粒细胞结合CD16b中被占用的位点。绿色勾表示Re-Glyco GlcNAc Scanning预测为占用,红色叉表示预测为未占用。b:CD16b(PDB 1E4J,青色)与CD16b(PDB 6EAQ,洋红色)的结构比对,PDB 6EAQ中N45和N162被占用,Re-Glyco正确预测。c:CD16b的糖基化重建结果。
亮点 4|AlphaFold结构可直接用于糖基化重建
作者测试了3415个AlphaFold蛋白质结构中的12789个N-糖基化位点,使用Re-Glyco连接一个基本的复杂七糖A2。结果显示85%的位点无冲突,15%存在不可解决的冲突。进一步分析发现,冲突主要发生在pLDDT中等置信度(65-90)的环区,这些区域的结构预测不确定性较高。通过使用ColabFold生成的替代结构或手动调整侧链取向,可以解决大部分冲突。这表明机器学习预测的蛋白质结构可以直接用于糖基化重建,但需注意低置信度区域。

图 5 Fig. 5。图5展示了AlphaFold结构的糖基化重建分析。a:直方图显示3415个AlphaFold蛋白质中与GlcNAc冲突残基的pLDDT分布,虚线为所有残基的pLDDT分布,粉蓝色为冲突被Re-Glyco解决的残基分布,蓝色为冲突未解决的残基分布。b-d:EXTL3单体结构(PDB 8OG1、AlphaFold、ColabFold)在PDB 7AU2同源二聚体溶剂可及表面轮廓内的视图,展示N592位点侧链取向差异。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 分子动力学模拟、PCA降维、高斯混合模型聚类、核密度估计、遗传算法
- 公开数据: 原文未给出公开组学登录号
- 代码: 公开仓库 https://github.com/Ojas-Singh/GlycanAnalysisPipeline、https://github.com/Ojas-Singh/GlycoShape、https://github.com/Ojas-Singh/Re-Glyco;本地已克隆:GlycoShape、Re-Glyco、GlycanAnalysisPipeline
- 谁该点开原文: 从事糖生物学、结构生物学、蛋白质组学或药物设计的科研人员,尤其是需要处理糖蛋白结构或预测糖基化位点的研究者。
带走一句
糖基化不再是结构分析的盲区。GlycoShape和Re-Glyco让任何有蛋白质结构的人都能快速恢复糖基化,并评估位点可及性,为功能研究和药物设计打开新窗口。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。