论文

表格基础模型的主动情境学习

Active In-Context Learning for Tabular Foundation Models

上下文与知识上下文工程

摘要

主动学习(AL)通过查询信息样本来降低标签成本,但在表格设置中,其冷启动增益通常是有限的,因为当模型在很少的标签上进行训练时,不确定性估计是不可靠的。 TabPFN 等表格基础模型通过上下文学习 (ICL) 提供校准的概率预测,即无需特定于任务的权重更新,从而实现了 AL 机制,其中标记的上下文(而不是参数)被迭代优化。我们形式化了表格主动上下文学习(Tab-AICL),并用四个获取规则对其进行实例化:不确定性(TabPFN-Margin)、多样性(TabPFN-Coreset)、不确定性-多样性混合(TabPFN-Hybrid)和可扩展的两阶段方法(TabPFN-Proxy-Hybrid),该方法在基于 TabPFN 的选择之前使用轻量级线性代理将候选者列入候选名单。在 20 个分类基准中,Tab-AICL 比重新训练的梯度提升基线(CatBoost-Margin 和 XGBoost-Margin)提高了冷启动样本效率,通过最多 100 个标记样本的归一化 AULC 进行测量。