论文
自生成反馈破坏测试时训练的稳定性:长视野适应的因果分解
Self-Generated Feedback Destabilizes Test-Time Training: A Causal Decomposition of Long-Horizon Adaptation
摘要
测试时训练 (TTT) 允许模型在推理期间将信息存储在其权重中。然而,当模型从自己的输出中学习时,每次更新也会更改生成下一个训练示例的模型。在 128K-token流中,保留生成的文本更新会恶化对具有三种 TTT-E2E 模型配置(标记为 125M、760M 和 3B)的独立人工编写文本的预测。当 Adam 更新 Qwen3-4B 的现有权重时,也会发生同样的故障。相同的更新机制可以改进真实文本,因此书写本身并不是失败。三个匹配的比较追踪了因果路径。固定生成通过使用冻结模型生成训练块,消除了 125M 和 760M 处超过 98% 的损坏。录制的重播将读取降级文本造成的损失与更新所存储的额外损失分开。然后,配对的一次更新比较显示了局部冲突:更新可以更好地预测其来源,但新的真实文本则更糟。这种成本在闭环适应后会增加,少数轨迹导致了大多数重大故障。最后,结算在承诺之前在独立的真实文本上评估候选状态。它在 125M 和 760M 处留下了 0.07 和 -0.02 nat 的平均端点间隙,同时保留了真实文本自适应。这些结果促使我们在保留更新之前检查独立证据的预测。