IF50.5|TabPFN:小样本表格数据的可学习基础模型
一个在合成数据上预训练的Transformer,2.8秒内超越调参4小时的梯度提升树。
一个在合成数据上预训练的Transformer,2.8秒内超越调参4小时的梯度提升树。
这篇按生信解读号的读法拆:先看背景和问题,再看作者怎么做、做出了哪几条硬发现,最后把数据和代码收走。
研究背景
表格数据广泛存在于生物医学、粒子物理、经济与气候科学等领域,核心预测任务是根据特征列填补标签列。过去20年,梯度提升决策树(如XGBoost、CatBoost、LightGBM)一直主导表格数据建模,而深度学习虽然在图像、文本上取得巨大成功,却因表格数据的异质性(混合类型、缺失值、异常值、无关特征等)难以直接应用。传统机器学习方法还存在分布外泛化差、知识迁移难、无法与神经网络结合等局限。近年来,基于Transformer的上下文学习(ICL)在语言模型中展现出强大能力,但如何将其有效迁移到表格数据仍是一个开放问题。
科学问题
卡在哪里: 现有表格学习方法多为人工设计算法,缺乏跨数据集的知识迁移能力,且在小样本(<10,000行)上性能有限。深度学习模型虽具灵活性,但受限于表格数据的异构性和小样本特性,表现不佳。此前TabPFN的初步版本仅适用于分类且规模受限,无法处理回归、缺失值、类别特征等实际场景。
本文要回答: 构建一个基于上下文学习的表格基础模型TabPFN,使其在中小规模表格数据(≤10,000样本、500特征)上以极短推理时间超越现有最优方法,并具备生成、密度估计、嵌入学习等基础模型能力。
技术路线
作者主要用了:结构因果模型生成合成数据、Transformer编码器、上下文学习、两路注意力机制。
作者首先设计了一个基于结构因果模型(SCM)的合成数据生成器,通过采样超参数构建因果图,并在图上传播噪声生成多样化的表格数据集,涵盖分类、回归、缺失值、类别特征等挑战。然后,在这些合成数据上预训练一个Transformer模型,使其学习根据上下文样本预测被掩码的目标值。该模型采用针对表格结构的两路注意力机制:先对行内特征做注意力,再对列内样本做注意力,从而保持样本和特征顺序不变性。预训练完成后,模型可直接应用于真实数据集,通过一次前向传播完成预测。

图 1 Fig. 1。图1展示了TabPFN的预训练与使用流程:先在数百万合成任务上训练Transformer,然后对真实数据集进行上下文学习预测。架构上,每个单元格独立表示,先做特征间注意力,再做样本间注意力,保持行列顺序不变性。
核心亮点
亮点 1|小样本性能全面超越基线
在AutoML Benchmark和OpenML-CTR23共29个分类、28个回归数据集上,TabPFN默认配置(平均2.8秒分类、4.8秒回归)在归一化ROC AUC上比最强默认基线CatBoost高0.187(0.939 vs 0.752),在调参4小时后仍高0.13(0.952 vs 0.822)。回归任务中,TabPFN默认配置在归一化RMSE上比CatBoost默认高0.051,调参后高0.093。TabPFN的默认性能甚至超过调参4小时的XGBoost、CatBoost、随机森林等,速度提升达5140倍(分类)和3000倍(回归)。

图 2 Fig. 2。图2详细描述了合成数据生成流程:先采样高层超参数,再构建结构因果模型(SCM),通过计算图传播噪声生成样本,最后从特征和目标节点提取数据。该流程能产生多样化的表格数据集,涵盖缺失值、类别特征等挑战。
亮点 2|对数据缺陷稳健
通过添加无关特征、注入异常值、减少样本或特征等扰动实验,TabPFN表现出对无关特征和异常值的强鲁棒性,优于MLP等神经网络基线。在仅使用一半训练样本时,TabPFN仍能达到CatBoost使用全部样本的精度。按数据集特征(是否含类别特征、缺失值、样本量、特征量)分组分析显示,这些因素对TabPFN相对性能影响不大。

图 3 Fig. 3。图3a对比了TabPFN与线性回归、MLP、CatBoost在多个玩具函数上的表现,TabPFN能同时拟合光滑和非光滑函数,且能输出分布而非单点预测。图3b展示TabPFN在双缝干涉实验中预测光子强度分布,仅需1.2秒,而调优后的CatBoost预测质量更差且耗时169.3秒。
亮点 3|集成调优进一步提升
引入TabPFN (PHE),利用后验集成(PHE)自动组合多个TabPFN模型并调优超参数。在分类任务上,TabPFN (PHE)平均归一化ROC AUC达0.971,超过AutoGluon(调参4小时)的0.914和TabPFN默认的0.939。在回归任务上,TabPFN (PHE)在300秒最小调优预算下即超过调参4小时的AutoGluon,速度提升48倍。

图 4 Fig. 4。图4a显示TabPFN在默认和调优设置下均显著优于其他基线,分类ROC AUC和回归RMSE的归一化得分均最高。图4b的逐数据集对比显示TabPFN在大多数数据集上获胜。图4c表明TabPFN默认性能超过调参4小时的基线,且推理时间极短。
亮点 4|基础模型能力:生成、密度估计、嵌入
TabPFN可估计数值特征的密度函数和类别特征的概率质量函数,用于异常检测。通过逐步采样特征,可生成模拟真实数据分布的新样本,用于数据增强或隐私保护。从模型最后一层提取的嵌入在mfeat-factors数据集上比原始数据具有更好的类别分离度。此外,在正弦曲线数据集上微调TabPFN可迁移知识,即使微调与测试标签分布差异较大,性能仍随分布相似度增加而提升。

图 5 Fig. 5。图5a显示TabPFN对无关特征和异常值稳健,且用一半样本即可达到CatBoost全样本精度。图5b按数据特征分组分析,显示TabPFN性能不受类别特征、缺失值、样本量、特征量显著影响。图5c-d比较TabPFN (PHE)与AutoGluon,显示TabPFN (PHE)在分类和回归上均优于AutoGluon,且速度更快。
生信可带走
这一块是给做分析的人用的,不是科普点缀。
- 方法栈: 结构因果模型生成合成数据、Transformer编码器、上下文学习、两路注意力机制
- 公开数据: 原文未给出公开组学登录号
- 代码: 原文未给出公开 GitHub/GitLab 仓库
- 谁该点开原文: 从事表格数据建模、尤其是小样本场景的数据科学家和生物信息学研究者。
带走一句
对于小样本表格数据,可优先尝试TabPFN作为强基线,其默认配置已接近甚至超过调参后的梯度提升树,且推理极快,适合快速迭代。
本页供学习交流,不替代原文,也不代表原作者、期刊或资助方立场。引用科学结论请以正式发表版本为准。 图表按 CC BY(可转载,需署名) 使用。 版权声明

需要同类分析?扫码加微信,一对一沟通需求,交付后终身售后。