论文

无需训练 环形 Transformer

Training-Free Looped Transformers

模型推理测试时计算扩展

摘要

我们引入了 无需训练 循环 Transformer,其中轻量级推理时间包装器循环冻结检查点的连续中间堆栈块,无需额外的 微调、持续训练或架构更改。与之前使用循环结构端到端进行训练的循环 Transformer 方法不同,我们在测试时将递归改进到预训练模型上。我们表明,简单的块重新应用通常会降低性能,这凸显了循环应用策略的重要性。通过将预范数 Transformer 块视为 ODE 上的前向欧拉步骤,我们将循环视为同一近似值的细化,用较小的阻尼子步骤替换一个较大的更新。在七个密集、稀疏 MoE 和 MLA+MoE 模型系列中,我们的方法在 MMLU-Pro 上将 Qwen3-4B-Instruct 提高了 +2.64 pp,在 CommonsenseQA 上将 Qwen3-30B-A3B-Instruct 提高了 +1.14 pp,在 OpenBookQA 上将 Moonlight-16B-A3B-Instruct 提高了 +1.20 pp。