论文
Retro:表格基础模型中的跨层表征重访
Thinking in Depth: Retrospective Inference for Tabular Foundation Models
摘要
表格基础模型 (TFM) 在不同的表格任务中进行预训练,并在推理时使用其标记示例作为上下文对新表进行预测。最近的 TFM 使用堆叠的 Transformer 层执行此类上下文预测,反复改变示例的表示和比较方式。通过通过几个强大的 TFM 跟踪单个查询,我们发现预测细化在深度上非常不均匀,并且通常集中在后面的层中。这种不均匀的细化促使我们重新考虑如何在整个网络中构建和重用中间表示。我们引入了 Retro,一种基于回顾性推理的表格基础模型,其中后期阶段可以明确地重新访问和重新组合网络中早期产生的中间信息。 Retro 围绕两个互补的操作组织此过程:要重新访问哪些中间信息,以及如何针对每个查询形成最终的上下文更新。注意力残差通过自适应地重新加权不同的贡献来解决前者 深度,而查询条件门控注意力通过跨表示维度逐元素调节注意力输出来解决后者。我们的分析表明,Retro 更早、更广泛地跨深度转变预测细化,不同阶段以暗示多视图细化的模式修改不同的查询子集。在 TabArena、TALENT 和 RelArena 中,Retro 名列前三,位于帕累托前沿。这些结果表明,直接重用中间表示提供了一种更好地利用 TFM 深度的实用方法。
