IF36.1|ImmunoMatch:用机器学习预测抗体轻重链配对
AI模型从序列中学习抗体轻重链配对规则,揭示B细胞成熟中的配对优化。
AI模型从序列中学习抗体轻重链配对规则,揭示B细胞成熟中的配对优化。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
抗体由重链(H)和轻链(L)组装而成,其配对稳定性对抗体功能至关重要。在体内,B细胞发育过程中会经历检查点,淘汰不稳定或自反应的H-L配对,保留能形成稳定受体的细胞。然而,H-L配对是否具有序列特异性一直存在争议。早期结构分析表明H-L界面由CDR和框架区共同构成,但基于小样本的统计研究未能得出一致结论。单细胞测序技术提供了大量天然配对的H-L序列,为研究配对规则提供了数据基础。已有一些AI模型尝试从配对数据中学习,但尚未系统解决H-L配对预测问题。
科学问题
卡在哪里: 此前研究受限于缺乏大规模配对的H-L序列数据,且未充分考虑轻链类型(κ和λ)的差异。此外,由于体内天然淘汰了不稳定配对,缺少真正的负样本,导致模型训练困难。现有方法在预测H-L配对时准确率有限,且未探索其在空间转录组等无单细胞分辨率数据中的应用。
本文要回答: 开发一个机器学习框架,从序列中学习抗体H-L配对规则,区分天然配对与随机配对,并应用于B细胞发育研究和抗体发现。
技术路线
作者主要用了:单细胞BCR测序、蛋白质语言模型(AntiBERTa2)、空间VDJ测序、机器学习。
作者从多个单细胞BCR数据集中提取天然配对的H-L序列作为正样本,通过交换轻链生成伪负样本,构建平衡训练集。比较了基于基因使用、CDR3序列和全长序列的多种模型,发现基于AntiBERTa2的微调模型性能最佳。进一步根据轻链类型(κ或λ)分别训练专用模型,以捕捉不同轻链的配对特征。最终模型用于空间转录组数据中的H-L配对重建、B细胞发育阶段分析以及治疗性抗体的序列敏感性评估。

图 1 Fig. 1。图1展示了抗体H-L界面结构及模型训练流程。a部分显示VH-VL界面由CDR和框架区共同构成;b部分说明正负样本构建策略;c部分量化了界面中各区域的贡献;d-f比较了不同模型架构的性能,最终基于AntiBERTa2的ImmunoMatch在测试集上AUC-ROC达0.75,外部验证为0.66。
核心亮点
亮点 1|全长序列模型优于CDR3或基因使用
作者首先测试了仅使用V/J基因使用或CDR3序列的模型,发现逻辑回归和XGBoost的准确率仅约0.5,CNN模型也仅略好。而基于AntiBERTa2的全长VH-VL序列微调模型(ImmunoMatch)在测试集上AUC-ROC达到0.75,在外部数据集上为0.66。这表明框架区残基对H-L配对有重要贡献,仅靠CDR3或基因使用不足以捕捉配对信号。

图 2 Fig. 2。图2比较了κ和λ轻链的序列差异及模型性能。a部分显示κ和λ序列平均一致性仅47.8%;b部分展示分别训练ImmunoMatch-κ和ImmunoMatch-λ的策略;c-d部分显示轻链特异性模型将配对分数分布从0.5附近推向1;e部分显示ImmunoMatch-κ和ImmunoMatch-λ在各自测试集上准确率分别为0.817和0.764,且ImmunoMatch-λ对κ数据也有较好泛化。
亮点 2|轻链特异性模型显著提升性能
由于κ和λ轻链序列差异较大(平均序列一致性仅47.8%),作者分别训练了ImmunoMatch-κ和ImmunoMatch-λ。在各自测试集上,ImmunoMatch-κ准确率达0.817,ImmunoMatch-λ达0.764,均优于原始模型。有趣的是,ImmunoMatch-λ在κ数据上仍保持较高准确率,而ImmunoMatch-κ在λ数据上性能下降。作者认为这与B细胞发育中κ重排失败后才进行λ重排的生物学过程有关,使得λ配对数据更具同质性。

图 3 Fig. 3。图3展示ImmunoMatch在空间转录组数据中的应用。a部分显示单细胞数据中配对分数的分布;b部分比较了ImmunoMatch分数与Engblom等人‘repair’分数,发现两者结合可提高配对识别准确性;c部分展示在肿瘤切片上预测的H-L对空间分布,表明ImmunoMatch能补充基于共定位的方法。
亮点 3|空间转录组中重建H-L配对
作者将ImmunoMatch应用于Engblom等人的乳腺癌空间VDJ数据,该数据无法直接获得单细胞水平的H-L配对。通过计算配对分数,ImmunoMatch能够识别出与单细胞数据重叠的H-L对,并与基于共定位的‘repair’方法互补。这为空间转录组学中的抗体配对分析提供了新工具。

图 4 Fig. 4。图4展示B细胞成熟过程中配对分数的变化。a部分显示记忆B细胞配对分数显著高于naive B细胞,GC B细胞居中;b部分展示克隆树中配对分数随突变增加而升高;c部分显示重链类别转换和突变水平与配对分数正相关;d部分显示白血病和淋巴瘤样本的配对分数差异,反映其起源的成熟阶段。
亮点 4|配对分数随B细胞成熟而升高
分析来自naive、生发中心(GC)和记忆B细胞的配对序列,发现记忆B细胞的配对分数显著高于naive B细胞,GC B细胞介于两者之间。进一步分析显示,随着重链类别转换(从IgM/IgD到IgG/IgA)和体细胞高频突变水平增加,配对分数也升高。在白血病和淋巴瘤样本中,起源于前B细胞的白血病配对分数低,而淋巴瘤配对分数高,反映了不同成熟阶段的特征。

图 5 Fig. 5。图5展示ImmunoMatch对治疗性抗体的序列敏感性。a部分概述实验设计:保留CDRH3,随机生成VH并与原始VL配对评分;b部分显示天然配对分数显著高于随机配对;c部分显示序列一致性高时配对分数差异小;d部分定位了导致分数差异的关键残基,主要位于CDRH1、CDRH2和框架区界面位置。
亮点 5|对治疗性抗体的序列差异敏感
作者模拟了抗体筛选场景:对625个治疗性抗体,保留其CDRH3,随机生成VH序列并与原始VL配对评分。结果显示,随机配对的分数显著低于天然配对(P<2×10^-16)。当随机VH与天然VH序列一致性≥80%时,配对分数差异通常较小;但若差异位于CDRH1、CDRH2或框架区面向VL的界面位置,则分数差异显著。这证明ImmunoMatch对H-L界面关键残基敏感。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 单细胞BCR测序、蛋白质语言模型(AntiBERTa2)、空间VDJ测序、机器学习
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事抗体工程、B细胞免疫学或空间转录组分析的研究者。
带走一句
做抗体配对分析时,别只看CDR3或基因使用,全长序列和轻链类型特异性模型能显著提升预测准确性。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。