论文
表格基础模型中稀疏先验的架构对齐
Architecture Alignment With Sparse Priors in Tabular Foundation Models
摘要
表格基础模型 (TFM) 越来越受欢迎,因为它们可以通过上下文学习对新数据集进行强有力的预测,而无需特定于任务的训练或广泛的调整。然而,已发布的 TFM 在预训练先验、架构和目标方面同时存在差异,从而掩盖了各自的归纳偏差。因此,我们研究了一项具体功能:不相关特征抑制。在合成任务和现实数据集中,添加空特征会导致行标记模型 TabDPT 的预测性能大幅下降,而单元标记交替轴模型 TabPFN v2 和其他 TFM 则保持相对稳定。这种差距促使我们思考架构是否有助于抑制不相关的特征。由于已发布的 TFM 仍然与其他设计选择相混淆,因此我们在相同的稀疏到密集线性先验下训练流线型行标记和交替轴变换器。精确贝叶斯分析表明,稀疏预测需要上下文相关的特征门控,而密集端点仅需要统一的特征权重。与这种区别一致,交替轴模型在稀疏任务上更接近贝叶斯最优预测器,而在密集任务上架构差距变得可以忽略不计;几乎所有的稀疏间隙都是由线性系数估计误差引起的。最后,在受控模型和冻结的 TabPFN v2 中,我们检查了干预对特征注意输出对线性系数的影响,找到了通过特征索引路径进行任务相关选择性计算路由的证据。总之,这些结果支持架构优先对齐:保留可寻址特征轴为任务自适应相关性推理提供归纳偏差。代码可在 https://github.com/Tianqi-Zhao/ArchitecturePriorTFMs. 获取