论文

超越 IID:表格基础模型到底有多通用?

Beyond IID: How General Are Tabular Foundation Models, Really?

模型评测基准与评测资源

摘要

基于表格数据的预测机器学习的基础模型最近在学术界和工业界获得了巨大的关注。跨学科的研究社区越来越多地评估不同数据集和任务上的表格基础模型。然而,由于基准软件和评估协议是分散的,模型研究人员在很大程度上仍然无法进行这些特定于任务和学科的评估。因此,模型研究人员依赖于标准基准,这些基准主要是针对表格基础模型已经表现出色的任务而定义的。最具挑战性的场景被排除在外,通过关注 IID 数据的边际改进而不是更广泛、更苛刻的挑战,限制了该领域有意义的进展。为了克服这个问题,我们引入了BeyondArena,这是第一个统一的表格数据整体基准,支持跨样本大小和特征维度的不同任务类型(IID、时间、分组),以及来自广泛学科的不同特征类型(带有文本、高基数)。为了实现超越标准基准的统一基准测试,我们引入了 Data Foundry,这是一个 Python 框架和元数据模式,用于整理用于预测机器学习的表格数据集。我们对 11 个模型和 142 个精选数据集的结果表明,现有的表格基础模型在中小型 IID 数据上表现出色,而传统的基于树的深度学习模型在非 IID、大型和高维数据集上仍然占主导地位。 BeyondArena 指导模型研究应对表格数据中最严峻的挑战,从而推动真正的基础表格模型取得进展。