论文

就地测试时训练

In-Place Test-Time Training

模型训练持续学习

摘要

静态“训练然后部署”范式从根本上限制了 大语言模型 (LLM) 动态调整权重以响应现实世界任务中固有的连续新信息流。测试时训练 (TTT) 通过在推理时更新模型参数子集(快速权重)提供了一种令人信服的替代方案,但其在当前 LLM 生态系统中的潜力受到关键障碍的阻碍,包括架构不兼容、计算能力等。在这项工作中,我们引入了就地测试时间训练(In-Place TTT),该框架无缝地赋予 LLM 测试时间训练能力,将普遍存在的 MLP 块的最终投影矩阵视为其自适应快速权重,从而无需昂贵的成本即可实现 LLM 的“直接”增强。从头开始再训练。此外,我们用定制的、基于理论的目标替换了 TTT 的通用重建目标,该目标与管理自回归语言模型的 Next-Token-Prediction 任务明确一致。这一原则目标与高效的分块更新机制相结合,产生了与上下文并行兼容的高度可扩展的算法。大量实验验证了我们框架的有效性:作为一种就地增强,它使 4B 参数模型能够在上下文高达 128k 的任务上实现卓越的性能,并且当从头开始预训练时,它始终优于与 TTT 相关的竞争方法。消融研究结果进一步为我们的设计选择提供了更深入的见解。总的来说,我们的结果表明就地 TTT 是朝着 LLM 持续学习范例迈出的有希望的一步。