论文

采用线性时间架构进行表格上下文学习

Adapting Linear-Time Architectures for Tabular In-Context Learning

摘要

表格基础模型通过调节上下文中的标记示例来实现强大的性能,但 softmax 注意力限制了它​​们在大型数据集上的使用。然而,现有的线性时间替代方案大多是因果关系,并且它们在表格上下文学习(ICL)方面的潜力仍未得到充分开发。为了解决这个问题,我们 (1) 重新审视因果训练设置,(2) 比较线性序列混合器,(3) 研究它们超出预训练上下文长度的 ICL 泛化。首先,我们表明因果模型的最佳训练设置类似于下一个标记预测。然后,也许令人惊讶的是,最有前途的线性序列混合器是因果的:DeltaNet 甚至优于非因果线性注意力。然而,它会使预训练上下文长度降低超过 $2$-$4\times$,并且现有的缓解策略(例如双向性)充其量只能推迟该问题。隐藏状态预言机表明这不是容量问题。相反,我们的分析指出了循环状态的不稳定性,它在因果模型的更深层次中漂移。由于 DeltaNet 学习到的写入速率过度适合预训练机制,因此我们通过时间相关的衰减计划干预来调节它们,以稳定长度泛化。最后,通过读取最终状态来重新引入非因果关系,使我们能够在 OpenML-CC18 和 TabArena 上紧密匹配受控的 softmax 注意力基线。