论文

Retro:表格基础模型中的跨层表征重访

Thinking in Depth: Retrospective Inference for Tabular Foundation Models

模型架构模型推理应用与实践Transformer推理策略与问题分解结构化分析、预测与决策

摘要

表格基础模型 (TFM) 在不同的表格任务中进行预训练,并在推理时使用其标记示例作为上下文对新表进行预测。最近的 TFM 使用堆叠的 Transformer 层执行此类上下文预测,反复改变示例的表示和比较方式。通过通过几个强大的 TFM 跟踪单个查询,我们发现预测细化在深度上非常不均匀,并且通常集中在后面的层中。这种不均匀的细化促使我们重新考虑如何在整个网络中构建和重用中间表示。我们引入了 Retro,一种基于回顾性推理的表格基础模型,其中后期阶段可以明确地重新访问和重新组合网络中早期产生的中间信息。 Retro 围绕两个互补的操作组织此过程:要重新访问哪些中间信息,以及如何针对每个查询形成最终的上下文更新。注意力残差通过自适应地重新加权不同的贡献来解决前者 深度,而查询条件门控注意力通过跨表示维度逐元素调节注意力输出来解决后者。我们的分析表明,Retro 更早、更广泛地跨深度转变预测细化,不同阶段以暗示多视图细化的模式修改不同的查询子集。在 TabArena、TALENT 和 RelArena 中,Retro 名列前三,位于帕累托前沿。这些结果表明,直接重用中间表示提供了一种更好地利用 TFM 深度的实用方法。

Retro:表格基础模型中的跨层表征重访:论文原图
图 3:TabICLv2 和 SDSS17 回顾性变体的预测裕度逐层变化。左侧和右侧网格分别显示 TabICLv2 和我们的回顾变体的所有 12 层的查询表示。在每个模型中,表示都被投影到适合其最终层支持嵌入的固定 PCA 基础上;因此,模型内的各个层之间的坐标是可比较的,但模型之间的坐标是不可比较的。颜色表示真实类别概率裕度相对于前一层的变化 (Δm\Delta m),绿色表示增加,紫色表示减少。圆圈标记查询从错误变为正确,十字标记相反。 L1 显示为灰色,因为没有测量前面的层。插图放大了 L1、L4 和 L7; L4 和 L7 插图使用单独标记的较窄色标来显示早期层的微小变化。 TabICLv2 在其大部分深度上表现出有限的直接可读变化,而回顾性变体则显示了跨更多阶段的不同查询的变化。完整的四模型可视化和聚合结果 C.1 和 A.4 节中出现了超过 38 个数据集。