论文

RecurTrace:使用循环时间内存进行自适应潜在推理

RecurTrace: Adaptive Latent Reasoning with Loop-Time Memory

模型架构递归架构

摘要

重复一小块中间层可以增加语言模型的有效推理深度,而无需添加参数或生成额外的标记,最近的工作表明这种潜在的递归可以改善推理。然而,两种设计选择限制了这些收益。每次迭代只能看到之前的输出,无法直接访问之前的计算。此外,固定的循环计数会浪费简单输入的深度,而使困难输入的计算量太少。我们引入了 RecurTrace,它使用循环自身的轨迹解决了这两个限制。具体来说,循环内存注意力让每个循环层沿着循环时间轴关注先前迭代中自己的状态,因此模型可以重新访问早期的计算,而不是仅仅依赖最新的状态。然后,停止的头读取循环状态并预测是否继续,在预言机的监督下,确定何时额外的深度仍然可以减少损失。在同一循环主干上的受控 MathQA 比较中,RecurTrace 平均 2.0 次循环实现了 56.9% 的准确率,在匹配计算时超出最佳固定循环深度 2.2 个点。相比之下,ACT 和 PonderNet 崩溃为一个循环,而 CALM 在 5.6 个循环时仅达到 54.1%,而更强的 LoopUS-Conf 和 TaH-Mismatch 基线在 3.2 个循环时达到 55.3%,在 2.1 个循环时达到 55.7%。最后,与相同预算的微调基线相比,RecurTrace 将生成精度提高了 0.6B、1.7B、4B 和 8B,并且增益随着模型大小从 0.6 点增加到 3.4 点而增长。