周启涛生物技术工作室
多组学与方法2025/09/23· 编译自 Nature Methods

IF36.1|从常见到稀有:迁移学习建模25万种节肢动物

CORAL借常见物种信息,让稀有物种也能被有效建模与预测。

CORAL借常见物种信息,让稀有物种也能被有效建模与预测。

这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。

研究背景

DNA宏条形码等新型监测技术能高效记录成千上万物种的时空分布,但其中绝大多数物种是稀有的,出现次数极少。传统物种分布模型通常设定出现次数阈值,直接剔除稀有物种,导致大量数据被浪费。联合物种分布模型(JSDM)虽然能同时建模多物种并借用物种间信息,但现有方法难以扩展到数十万乃至百万物种,且对极度稀有的物种表现不佳。HMSC框架通过系统发育或分类关系共享物种对环境变量的响应,能有效借用信息,但计算负担限制了其在大规模群落中的应用。

科学问题

卡在哪里: 现有JSDM方法无法扩展到包含数十万稀有物种的数据集,而简单剔除稀有物种会损失绝大部分生物多样性信息。稀有物种数据稀疏,单独建模时参数估计极不稳定,但它们在保护生物学中往往最需要关注。

本文要回答: 开发一种计算高效且统计有效的建模方法,能够同时推断和预测常见与稀有物种的分布,充分利用大规模群落数据中的全部信息。

技术路线

作者主要用了:贝叶斯迁移学习、HMSC、潜在因子、系统发育/分类先验、独立物种模型

作者提出CORAL(Common to Rare Transfer Learning)方法。首先用常见物种(出现≥50次)拟合HMSC骨干模型,估计环境响应系数和样本级潜在因子。然后将潜在因子作为额外预测变量,并为每个稀有物种构建条件先验:先验均值基于分类学相似性从常见物种系数借用信息,先验方差由分类距离决定。最后对每个稀有物种独立拟合贝叶斯probit模型,使用该信息先验更新其后验。由于稀有物种模型相互独立,计算可完美并行,从而扩展到数十万物种。

Fig. 1 · 原文图,按文末许可署名使用
Fig. 1 · 原文图,按文末许可署名使用

图 1 Fig. 1。图1展示了CORAL的三阶段流程:先用常见物种拟合HMSC骨干模型,估计环境响应和潜在因子;然后将潜在因子作为固定预测变量,并为稀有物种构建基于分类学相似性的条件先验;最后对每个稀有物种独立拟合贝叶斯模型。该图强调了与计算上不可行的联合建模的对比,以及并行化的优势。

核心亮点

亮点 1|CORAL显著提升稀有物种预测精度

对22,140个出现至少5次但未纳入骨干模型的物种进行交叉验证,CORAL相比基线模型大幅提升所有评估指标:AUC从0.86升至0.94,Tjur's R2从0.03升至0.08,PRAUC从0.07升至0.16,Brier score从0.004降至0.003,负对数似然从0.023降至0.016,对数行列式从-28.2降至-36.4,所有差异P<10^-16。进一步分析表明,大部分提升来自纳入潜在因子,而非直接借用分类学信息;潜在因子贡献了约75%的AUC增益。

Fig. 2 · 原文图,按文末许可署名使用
Fig. 2 · 原文图,按文末许可署名使用

图 2 Fig. 2。图2对比了骨干模型(仅常见物种)和CORAL模型(所有物种)对环境变量的响应。红色/蓝色大点表示常见物种的显著正/负响应,粉色/青色小点表示稀有物种。图中可见同色点聚集,表明分类学相关的稀有物种继承了常见物种的响应方向,但也存在例外,体现数据对先验的更新。

亮点 2|系统发育信号强,先验信息有效

骨干模型中物种对环境变量的响应具有强系统发育信号(后验均值ρ=0.65,后验概率Pr(ρ>0)=1.00)。方差缩放因子k介于0.13至0.70,均值0.34,表明先验方差大幅缩减。k值随与骨干模型中最近亲缘关系的分类等级降低而减小(图3a)。条件先验模型的判别能力(AUC)随亲缘关系等级提高而增加,且对出现次数较多的物种更准确(图3b)。

Fig. 3 · 原文图,按文末许可署名使用
Fig. 3 · 原文图,按文末许可署名使用

图 3 Fig. 3。图3a显示方差缩放因子k随与骨干模型中最近亲缘关系的分类等级变化:等级越近(如同属),k值越小,先验方差缩减越大。图3b显示条件先验模型的AUC随亲缘等级提高而增加,且对出现次数>10的物种AUC更高,均高于随机水平(AUC=0.5)。

亮点 3|CORAL后验解析近似,存储高效

CORAL后验被近似为多元正态分布,每个物种仅需存储均值向量和协方差矩阵(25个参数,共350个数值)。全部255,188个物种的模型仅占约1.1 GB。解析近似使得后验预测概率可直接计算,无需MCMC采样。模型校准良好:预测的物种出现次数与观测值基本一致(图5a),物种丰富度预测略有高估(图5b),温度与降水梯度上无系统偏差(图5c,d)。

Fig. 4 · 原文图,按文末许可署名使用
Fig. 4 · 原文图,按文末许可署名使用

图 4 Fig. 4。图4展示两个示例物种的预测:较常见的Garcorops madagascar(10次出现)和极稀有的Chrysops madagascarensis(1次出现)。CORAL模型的后验区间明显窄于基线模型,尤其对极稀有物种。图4c显示所有物种后验方差平均值的比较,CORAL方差更小,且缩减程度随与骨干模型亲缘关系增加而增大。

亮点 4|稀有物种环境响应可被可靠推断

通过将常见物种的出现数据随机稀疏化90%来模拟稀有物种,再用CORAL估计其环境响应,并与完整数据骨干模型估计值比较。结果显示高相关性:气候与季节预测变量平均相关系数0.68(标准差0.06),样本级潜在因子0.69(0.04),位点级潜在因子0.73(0.04)。表明CORAL能从极少量出现记录中恢复物种的环境响应。

Fig. 5 · 原文图,按文末许可署名使用
Fig. 5 · 原文图,按文末许可署名使用

图 5 Fig. 5。图5评估模型校准:a图比较每个物种的期望出现次数与观测出现次数,整体吻合但最稀有物种略有高估;b图比较样本物种丰富度的预测与观测,存在轻微高估;c和d图显示温度与降水梯度上预测与观测比例无系统偏差,表明模型对气候变量的响应建模合理。

生信可带走

这一块是给做分析的人用的,不是科普点缀。

  • 方法栈: 贝叶斯迁移学习、HMSC、潜在因子、系统发育/分类先验、独立物种模型
  • 公开数据: 原文未给出公开组学登录号
  • 代码: 原文未给出公开 GitHub/GitLab 仓库
  • 谁该点开原文: 从事大规模生物多样性数据分析、联合物种分布建模或宏条形码研究的生信与生态统计人员。

带走一句

面对超大规模稀有物种数据,先建常见物种骨干模型,再为每个稀有物种定制信息先验,可兼顾统计效率与计算可行性。

本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

微信二维码

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。

添加微信

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。