周启涛生物技术工作室
微生物组与感染2026/01/15· 编译自 Nature Methods

IF36.1|MaAsLin 3:同时解析微生物组丰度与存在性关联

新方法将微生物关联拆分为丰度与存在性,揭示IBD中77%的关联源于物种有无而非丰度变化。

新方法将微生物关联拆分为丰度与存在性,揭示IBD中77%的关联源于物种有无而非丰度变化。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

微生物组关联分析的核心任务是鉴定哪些微生物特征(如物种、基因、代谢物)与宿主表型或环境因素相关。然而,微生物组数据具有组成性、稀疏性和高维性等挑战,使得差异丰度(DA)测试方法众多但缺乏共识。现有主流工具如ALDEx2、ANCOM-BC和MaAsLin 2各有策略,但通常只关注丰度变化,而忽略微生物存在/缺失本身的生物学意义。实际上,病原体在极低丰度下即可致病,某些类群仅在特定人群中检出,存在性关联具有独立价值。此前方法将零值简单替换为伪计数,结果对伪计数选择敏感,且无法区分存在性与丰度信号。

科学问题

卡在哪里: 现有DA方法普遍将零膨胀仅作为技术噪声处理,未显式建模存在/缺失与协变量的关系;同时,基于相对丰度的推断受组成性偏差影响,缺乏对绝对丰度关联的可靠估计。此外,复杂实验设计(如纵向采样、多水平因子、功能学协变量)的支持不足。

本文要回答: 开发一个统一框架,同时识别微生物特征的丰度关联和存在性关联,并支持组成性校正、绝对丰度实验数据以及更丰富的协变量类型。

技术路线

作者主要用了:SparseDOSSA 2模拟、HMP2 IBDMDB队列、MetaPhlAn 4、混合效应模型、逻辑回归

作者构建了MaAsLin 3,将每个微生物特征拆分为存在/缺失(逻辑回归)和非零丰度(对数线性回归)两部分,分别建模后再合并整体效应。针对组成性,默认将丰度系数与所有特征系数的中位数比较,以近似绝对丰度关联;若提供spike-in或总生物量数据,则直接估计绝对丰度。此外,引入数据增强避免逻辑回归的线性分离问题,并标记可能由丰度变化诱导的虚假存在性关联。通过SparseDOSSA 2模拟不同样本量、零来源、关联比例和重复测量场景,并与ALDEx2、ANCOM-BC2、MaAsLin 2等比较,最后在HMP2 IBDMDB真实队列中验证。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示MaAsLin 3模型总览及基准测试。a部分示意输入特征表和元数据,经标准化、拆分存在/缺失与非零丰度后分别拟合逻辑和线性模型,输出关联表。b部分以E. rectale为例,伪计数线性回归显示与年龄无关联(P=0.86),但拆分后丰度负相关(β=-0.015, P=1e-9)而存在性正相关(β=0.010, P=0.005),说明信号相互抵消。c部分显示不同样本量下各方法F1分数,MaAsLin 3在>50样本时最优,且精度保持高位。

核心亮点

亮点 1|模拟数据中精度与召回全面领先

在超过50个样本的合成数据集中,MaAsLin 3的F1分数中位数不低于任何其他方法。其精度始终维持高位(50样本时平均0.99),而召回随样本量增加升至0.85(1000样本时),显著优于ALDEx2(召回不超过0.27)。即使仅模拟技术零,MaAsLin 3仍保持最高精度。在重复测量场景下,MaAsLin 3召回达0.80(10次重复),远高于ALDEx2的0.27;通过后置系数阈值(绝对值>1)可将精度恢复至0.92以上。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2比较MaAsLin 3不同建模选项的精度-召回曲线。a部分显示默认中位数校正(使用相对丰度数据)相比无校正或使用spike-in数据在固定召回下精度更高,尤其在1000样本高功效场景。b部分展示数据增强和丰度诱导存在性标记对精度的影响:两者均能在保持召回的同时提升精度,防止线性分离和虚假存在性关联。

亮点 2|中位数校正逼近绝对丰度关联

MaAsLin 3默认将相对丰度系数与所有特征系数的中位数比较,以推断绝对丰度关联。在模拟中,该策略在固定召回下提升精度;使用spike-in信息时精度进一步提高。在三个真实绝对丰度数据集(婴儿肠道、小鼠饮食、IBD/PSC)中,MaAsLin 3的相对丰度系数与实验估计的绝对丰度系数相关性高达0.95-0.96,斜率接近1,而MaAsLin 2和ALDEx2的相关性仅0.52-0.59,斜率严重衰减。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3检验当大部分特征真实关联时各方法的表现。a部分显示随着真实阳性关联比例增加,所有基于相对丰度的方法系数负偏倚加剧,但MaAsLin 3和ANCOM-BC2相对稳健;仅spike-in信息的方法完全无偏。b部分在三个真实绝对丰度数据集中,相对丰度系数与实验绝对丰度系数的相关性:婴儿肠道(稀疏度97%)相关性最低(0.47),小鼠饮食和IBD/PSC相关性高且斜率接近1。c部分比较各方法相对丰度系数与实验绝对丰度系数的回归斜率和相关性,MaAsLin 3和ANCOM-BC2表现最佳。

亮点 3|IBD队列揭示存在性关联主导

在HMP2 IBDMDB队列中,使用MetaPhlAn 4和MaAsLin 3共发现372个显著关联,其中77%(287个)为存在性关联,且89%为负向,表明IBD主要导致微生物完全丢失而非丰度降低。例如Dysosmobacter welbionis在CD和UC dysbiosis中仅存在性显著降低(β=-3.46至-4.14),丰度无显著变化,而MaAsLin 2无法区分此模式。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示HMP2 IBDMDB队列中成人(a)和儿童(b)IBD相关物种的差异关联。成人组有35个独特正关联,包括Enterocloster bolteae、Flavonifractor plautii等;儿童组有23个,包括Escherichia coli、Ruminococcus gnavus及益生菌Bifidobacterium breve。c部分聚焦Dysosmobacter welbionis,显示其在UC和CD dysbiosis中仅存在性显著降低(β负且q值小),丰度无显著变化,而MaAsLin 2无法区分此模式。

亮点 4|扩展协变量类型支持复杂设计

MaAsLin 3新增五类推断:一般混合效应模型、多水平因子的omnibus检验、有序预测变量的水平间差异检验、任意对比检验以及特征特异性协变量(尤其适用于宏转录组)。在HMP2宏转录组分析中,209个显著关联中68%为丰度关联,表明通路表达主要随丰度变化。在CD患者饮食频率分析中,有序与分组模型分别发现132和107个显著关联,重叠59个,验证了不同假设的互补性。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: SparseDOSSA 2模拟、HMP2 IBDMDB队列、MetaPhlAn 4、混合效应模型、逻辑回归
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 微生物组、宏基因组、代谢组领域需要做差异丰度或关联分析的研究者,尤其是处理稀疏数据和复杂表型的人群。

带走一句

做微生物组关联分析时,别再把零值简单伪计数处理;拆分存在性和丰度,并用中位数校正组成性,能发现更多真实且特异的信号。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。