使用下一个标记预测进行测试时训练
Test-Time Training with Next-Token Prediction
摘要
下一个标记预测是训练语言模型的自监督信号,每个观察到的提示标记在测试时都提供相同的信号。我们研究该信号是否可以定义预训练的长上下文语言模型中测试时训练(TTT)的内循环目标。许多 TTT 架构要求在训练模型时考虑测试时间适应,从而限制了它们对已发布的 LLM 检查点的直接适用性。虽然最近的就地 TTT 方法使预训练的 LLM 的快速权重适应成为可能,而无需重新设计主干,但它们留下了一个未解决的核心问题:每个测试时应该写入存储什么?现有的方法训练快速权重以匹配学习的局部值代理,但它们并不直接与自监督的下一个词元预测信号相关。我们引入了带有下一个标记预测的测试时训练(TTT-NTP),这是一种针对预训练 LLM 的快速权重适应方法,它使用模型自己的下一个上下文隐藏状态来监督更新。这使得每个本地写入遵循支持下一个词元预测的相同因果计算:值目标是单个下一个位置上下文状态的逐点线性投影。在 RULER Full-13 上,平均超过 4k 到 32k 上下文,TTT-NTP 是唯一能够持续改进跨越三个系列和 0.6-8B 大小范围的四个模型的已发布主干的方法,在 Llama-3.1-8B 上提高 3.9 点,在 Mistral-7B-v0.3 上提高 3.0 点,在 Qwen3-4B 上提高 4.1 点,在 Qwen3-4B 上提高 2.9 点Qwen3-0.6B。在现实世界的 LongBench-v2 长文档 QA 基准上,TTT-NTP 在 Llama-3.1-8B 上比基本模型提高了 5.6 个点,在 Mistral-7B-v0.3 上比基本模型提高了 3.7 个点,同时保留了常识和知识性能。我们的代码可在 https://github.com/yancyou/TTT-NTP 上公开获取。