论文
了解表格基础模型令人惊讶的泛化属性
Understanding the Surprising Generalization Properties of Tabular Foundation Models
摘要
表格基础模型 (TFM) 越来越依赖上下文学习,其中模型在推理时接收带标签的示例,并预测新输入的标签而不更新其权重。现有的 TFM 通常在大量合成语料库或非常大的真实数据集上进行训练。相比之下,我们表明,仅在一个真实的表上,自我监督的 预训练 就可以产生令人惊讶的强大迁移。在这种情况下,我们还发现,无论下游预测任务如何,表往往要么广泛有用,要么普遍较差,并且有用性的最强预测因素是特征数量而不是实例数量。这导致了对表格 预训练 的以任务为中心的解释:任务的数量和质量对于 TFM 的 预训练 至关重要。我们表明,相同的以任务为中心的视角可以帮助大规模的语料库设计:细粒度的列级预处理持续提高下游性能,而当我们在数据集级别进行过滤或重复数据删除时,没有观察到任何改进。最后,我们为 TFM 如何泛化提供了一个新的视角:我们认为表格上下文泛化很大程度上是基于检索的,好的模型是那些学会在所提供的上下文中识别相关示例并很好地聚合它们的模型。 TFM 的机制相对而言还没有得到足够的研究。我们以任务为中心、基于检索的视角提供了一个新的框架来指导未来的模型和语料库设计。