论文

PACE:使用预训练的表格基础模型进行特征筛选的即插即用上下文嵌入

PACE: Plug-and-Play Contextual Embedding for Feature Screening with Pretrained Tabular Foundation Models

应用与实践结构化分析、预测与决策

摘要

在高维表格学习中,特征筛选提供了一种轻量级的、与模型无关的方法,可以在模型拟合之前删除不相关的特征。然而,直接对原始值进行评分可能会错过非线性或分布结构。我们引入了 PACE(即插即用上下文嵌入),它在现有的特征评分规则之前插入冻结表格基础模型(TFM)列编码器,将每个特征扩展为更高维度的上下文表示。在对照研究中,PACE 改进了复杂非线性依赖性的原始空间筛选,而仅需要适度的额外编码成本。这些收益转化为 TALENT 数据集上的下游预测:PACE-DC 将二进制 AUC 提高了 0.077,将多类宏 AUC 提高了 0.064,十个学习者的中位归一化 RMSE 提高了 0.063。匹配的随机权重和随机特征控制表明,PACE 从预训练结构中获得的收益超出了通用维度扩展。 PACE 进一步实现了良好的性能——与适合任务的选择器和基于归因的方法进行时间权衡,将预训练的列几何形状定位为表格学习的可重用上游原语。