论文

更好地(几乎)免费地解码环形Transformer

Decoding Looped Transformers Better for (Almost) Free

模型推理解码与生成控制

摘要

循环Transformer通过在循环循环中重复执行共享块来实现参数效率。每个循环都会生成可解码的下一个相同标记的中间表示,但标准解码会丢弃较早的状态。因为早期的循环包含较少的计算,所以递归本质上提供了对齐的弱和强预测对,而无需辅助模型或外部训练。我们引入了 LoopCD,一种免训练的对比解码框架,通过将最终预测与早期的循环传递进行对比来指导标记选择,在具有一个额外输出传递的 logit 空间 (LoopCD-Logits) 或具有零输出开销的隐藏状态空间 (LoopCD-Hidden) 中运行。在四个循环 Transformer 系列中,LoopCD 在完全循环深度上提供了实质性、一致的增益:LoopCD-Logits 将 Ouro-2.6B-Thinking 的 AIME 2024 pass@1 从 61.88% 提高到 73.33%,而 LoopCD-Hidden 将 Huginn 的 HumanEval pass@1 从 22.56% 提高到 31.71%。至关重要的是,这些性能提升使得循环次数减半,同时仍然匹配或超过全深度无引导基线,从而将前向 FLOP 减少 22.5% 至 48.2%。通过将中间循环状态转换为有效的引导信号,LoopCD 实现了卓越的解码质量,同时大大减少了推理计算。