论文
注意差距:表格基础模型真实与合成先验的分布比较
Mind the Gap? A Distributional Comparison of Real and Synthetic Priors for Tabular Foundation Models
摘要
表格基础模型是在三类语料库之一上进行预训练的:从基准存储库中提取的精选数据集、从网络上大规模收集的表格或从参数生成先验中采样的合成表格。尽管预训练数据对于模型性能至关重要,但人们对这些语料库在分布中如何相互关联以及这对下游性能的影响知之甚少。在这项工作中,我们采用三个规范的原型数据集来训练表格基础模型; T4 数据集代表网络抓取的语料库,TabFM 数据集来自 Kaggle 整理的表格,TabICL 数据集是唯一使用广泛且具有公开可用参数的合成先验数据集。我们使用整个表、列和相关性的聚合特征来表征每个语料库,并使用判别器 AUC 和 k-NN 覆盖率指标来比较它们。我们发现 TabICL 合成先验占据了真实表空间的狭窄区域,这种不匹配无法通过优化超过 86,000 个配置的先验超参数来关闭,并且整理得到的语料库和网络抓取语料库在特征空间的分布级别上可以广泛互换。令人惊讶的是,无论是基于特征的邻近度度量还是 TabICL 自己的内部表示,合成预训练数据和真实表之间的分布差距对性能均未表现出可明确检测的影响,这表明真实数据分布的覆盖范围并不是 TabICL 泛化的主要驱动力。
