论文
LUCoS:表格基础模型的潜在无监督上下文选择
LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models
摘要
选择要标记的实例是低标签表格学习中的一个关键挑战。对于最近的表格基础模型(例如 TabPFN),上下文选择直接决定预测性能。监督预言机实验表明,在相同的标签预算下,精心选择的标记上下文集可以远远优于随机选择。然而,冷启动设置(必须在任何标签可用之前选择实例)在 TFM 文献中很少受到关注。这个问题本质上是几何问题。在视觉和语言中,基础模型引入了简单的几何选择方法有效的嵌入空间。相比之下,到目前为止,表格实例选择主要是在原始表格空间中执行的,缺乏自然的度量;异构类型、混合尺度和非线性交互使得原始空间距离对于上下文构建来说不可靠,并且随着预算的增长,原始空间选择在大多数数据集上低于随机。我们提出了 LUCoS(潜在无监督上下文选择),它将原始特征几何图形替换为由无监督先验拟合网络(PFN)的嵌入引起的潜在几何图形,并选择代表性中心点作为上下文。在六个低标签预算的 67 个 OpenML-CC18 数据集上进行评估,LUCoS 在平均 AUC、ACC 和 F1 项下排名第一,结论在指标和数据集级稳健性检查中保持稳定。收益分解揭示了一个简单的机制:在最小的预算下,主要收益来自于强制覆盖;随着预算的增加,决定性因素就变成衡量覆盖范围的代表性空间。 LUCoS 减轻了原始特征空间选择的失败,表明可靠的无监督上下文选择较少依赖于选择器的复杂性,而更多地依赖于在有意义的表示几何中定义代表性。