论文

再循环

Recirculation

模型架构递归架构

摘要

我们描述了现成基础模型的推理时间架构增强功能,可以系统地减少复杂性并提高生成和推理任务的准确性。我们的方法在生成过程中基本上不会产生额外的延迟,尽管它需要在预填充阶段进行串行处理。受前馈 Transformer 中的状态更新受模型深度限制这一基本限制的启发,我们的技术“再循环”引入了一种特定形式的递归,允许模型充当动态系统并跟踪信念状态。我们将该技术与思想链计算(更好地保留用于复杂推理而不是基本状态跟踪)以及流行的深度递归技术(循环)和循环 Transformer 的昂贵训练区分开来。我们还提出并评估了一种自适应的再循环变体,它只需要对超参数进行轻微调整,同时冻结原始模型权重。相对于现成的基线,自适应再循环在 Gemma3 系列上取得了令人惊讶的进步,包括一系列数据集上的困惑度持续降低,GSM8k 上的相对准确度提高了 21%,以及其他下游任务的准确度可靠提高。我们的 无需训练 方法通过利用模型本身来通知架构修改而取得成功,提出了一条由训练有素的网络属性而不是强制的、任意的设计选择指导的架构演进路线。