论文
TEMPO:大型推理模型的扩展测试时间训练
TEMPO: Scaling Test-time Training for Large Reasoning Models
摘要
测试时训练 (TTT) 在推理时间内调整未标记测试实例上的模型参数,从而不断扩展离线训练范围之外的功能。尽管取得了初步成果,但 LRM 的现有 TTT 方法很快就陷入停滞状态,并且无法从额外的测试时计算中受益。如果没有外部校准,随着政策模型的发展,自我生成的奖励信号会越来越漂移,导致绩效停滞不前和多样性崩溃。我们提出了 TEMPO,一种 TTT 框架,它将未标记问题的政策细化与标记数据集上的定期批评家重新校准交织在一起。通过期望最大化(EM)算法形式化这种交替过程,我们发现先前的方法可以被解释为省略关键重新校准步骤的不完整变体。重新引入此步骤可收紧证据下限 (ELBO) 并实现持续改进。在不同的模型系列(Qwen3 和 OLMO3)和推理任务中,TEMPO 将 AIME 2024 上的 OLMO3-7B 从 33.0% 提高到 51.1%,将 Qwen3-14B 从 42.3% 提高到 65.8%,同时保持高度多样性。