论文

缩小上下文差距:表格上下文学习的激活对齐

Closing the Context Gap: Activation Alignment for Tabular In-Context Learning

摘要

表格基础模型通过对作为上下文提供的标记训练示例进行条件预测来执行上下文学习 (ICL)。与将训练与推理分开的传统模型不同,这些模型必须在每次前向传递中处理所有训练示例,这使得每次预测的成本都很高。限制训练示例的数量可以降低此成本,但会显着降低性能。我们提出激活对齐,而不是丢弃上下文,这是一种利用完整上下文来教导模型在仅看到子集时如何表现的方法。这是通过训练对合成未标记数据进行轻量级线性变换来实现的,以将数据约束的“学生模型”(使用部分上下文)的中间激活映射到全上下文“教师模型”(使用所有数据)的中间激活。 训练对准器不需要 GPU,并且可以在商用硬件上在几秒到几分钟内收敛。我们使用领先的两个表格基础模型 TabPFN-3 和 TabFM 对来自 TabArena 基准的 38 个分类数据集进行评估。在所有上下文预算中,对齐的学生模型比两个模型的未对齐基线产生了广泛的、统计上显着的改进。在低数据情况下,对齐恢复了教师模型预测优势的近一半。该方法提供了一种实用的、低开销的方法来实现紧凑上下文的推理速度,同时缩小与全上下文教师模型的性能差距的很大一部分。

缩小上下文差距:表格上下文学习的激活对齐的原论文方法或结果图
图 2:在 TabPFN 和 TabFM 的 38 个 TabArena 分类数据集(5 次重复)上,对齐的学生模型相对于未对齐的基线学生模型和全训练预算 XGBoost 跨上下文分数 $\alpha\in\{0.1,\dots,0.5\}$ 的成对获胜率。图例中报告了所有上下文预算的总体胜率(TabPFN 相对于基础为 82.2%,相对于 XGBoost 为 81.1%;TabFM 相对于基础为 79.8%,相对于 XGBoost 为 80.3%)。每个条上方的统计显着性注释表示针对相应比较器的两侧配对 Wilcoxon 符号秩检验结果(${}^{***}p<0.001$、${}^{**}p<0.01$、${}^{*}p<0.05$;n.s.:不显着)。