论文

TabFM:表格数据的零样本基础模型

TabFM: A Zero-Shot Foundation Model for Tabular Data

应用与实践结构化分析、预测与决策

摘要

表格机器学习通常依赖于每个数据集的工作流程、拟合树集成或从头开始为每项任务运行 AutoML 搜索。我们提出了 TabFM,这是一个 4 亿参数的表格基础模型,它将监督表格预测制定为上下文学习。 TabFM 在一次前向传递中生成校准的零样本预测,无需针对特定任务进行调整。 TabFM 完全基于结构因果模型生成的合成表进行训练,可以学习将零样本转移到现实世界任务的通用表格表示。在 TabArena 的所有 51 个基准数据集(38 个分类和 13 个回归)中,零样本 TabFM 在默认表格基础模型中排名第一,并且优于经过调整的 AutoML 管道。对相同冻结权重的两次扩展进一步提高了两个轨道上的性能:具有集成和事后校准的多视图特征扩展(TabFM+),以及LLM引导的、特定于数据集的数据处理和特征工程(TabFM-Auto)。