论文
塑造先验:综合任务分布如何确定表格基础模型质量
Shaping the Prior: How Synthetic Task Distributions Determine Tabular Foundation Model Quality
摘要
什么决定了表格基础模型的质量?与语言或视觉不同,表格基础模型几乎完全从合成预训练分布中获得归纳偏差,但这些分布的设计仍然知之甚少。标准的综合先验表现得太好:它们忽略了决定部署鲁棒性的不规则性和故障模式。我们介绍 O'Prior,一种围绕四个耦合组件构建的组合现实主义先验:跨越不同功能族的分层 SCM 元生成器;模块化现实主义引擎,涵盖异构边缘、缺失和目标变换;显式压力模块注入混淆和支持查询不匹配;以及一个受课程管理的、防泄漏的生成协议。为了将先前的设计隔离为科学变量,我们保持架构、优化器和计算预算固定,仅改变合成任务分布。 O'Prior 在实际表格基准中的下游准确性和鲁棒性方面取得了一致和实质性的改进,收益集中在以分布不规则为特征的制度中。消融证实机制多样性、现实主义构成和转变意识压力各自独立贡献,它们的影响不可互换。这些结果将综合先验构造确立为平板基础模型质量的一阶且很大程度上被忽视的决定因素