论文

TabH2O:表格预测的统一基础模型

TabH2O: A Unified Foundation Model for Tabular Prediction

模型训练预训练

摘要

我们提出了 TabH2O,这是一种表格数据的基础模型,可通过上下文学习在单次前向传递中执行分类和回归。 TabH2O建立在TabICL架构之上,并进行了几个关键修改:(1)统一训练,单个模型通过双头架构处理分类和回归,消除了对单独模型的需要并降低了总预训练成本; (2)单阶段预训练、训练稳定性改进(有界可扩展softmax、阶段间归一化、可学习残差缩放、logits软上限)消除了多阶段课程学习的需要,使得从一开始就可以使用全长序列进行训练; (3) 噪声感知预训练,合成数据集包括显式噪声维度,以教导模型对不相关特征的鲁棒性。我们在 TALENT 基准(300 个数据集)上评估 TabH2O v1.1(29.2M 参数),在 6 种评估方法中获得了 2.54 的平均排名,优于经过调整的 CatBoost (4.00)、H2O AutoML (4.28)、LightGBM (4.98) 和 TabPFN v2.6 (2.80),并且与 TabICL v2 相比具有竞争力(2.13),同时在分类和回归任务的 80% 测试数据集上排名前三。我们还在 TabArena 上取得了最先进的结果。此外,我们的单一模型非常适合最多大约 500,000 行和 100 个特征的表格数据集。