论文
学习要记住的内容:通过上下文进行测试时训练 蒸馏
Learning What to Remember: Test-Time Training via Context Distillation
摘要
有效的长上下文建模不仅要保留更多过去的信息,还要保留以后可能证明相关的信息。测试时训练 (TTT) 是一种有吸引力的方法,可以为长上下文建模执行在线参数更新,但现有的 TTT 方法仅优化重建或在线适应目标,而没有考虑保留信息的未来效用。在这项工作中,我们提出了 \textbf{T}est-\textbf{T}ime \textbf{C}ontext \textbf{D}istillation (TTCD),这是一个 TTT 框架,引入了一个自我监督的目标,用于分配有限的内存容量以供将来使用。具体来说,TTCD 使用长窗口教师来监督短窗口学生的快速权重,其中它们之间的隐藏状态差异提供了密集的自我监督信号,指导模型记住对未来词元预测至关重要的上下文信息。我们专注于一种就地变体:就地 TTCD (IP-TTCD),它使用现有的 MLP 参数作为快速权重。长上下文语言建模任务的实验表明,从头开始预训练时,IP-TTCD 始终优于 DeltaNet、Gated DeltaNet、滑动窗口注意力和 TTT。此外,IP-TTCD 允许预先训练的 Transformer 模型在推理期间通过连续的 预训练 调整其参数,仅通过轻量级架构增强即可获得长上下文功能。我们的结果将 TTCD 定位为迈向架构持续学习的一步。