论文
循环Transformer中的递归推理调度
Scheduling Recursive Reasoning in Looped Transformers
摘要
循环推理模型在扩展测试时间计算方面引起了越来越多的关注,通常是通过使用共享参数迭代地细化潜在状态。然而,这些模型以固定的单位规模应用每个学习的更新,当更新持续进展时,这可能会保守,而当更新波动时,这可能会过于激进,从而限制了额外循环的好处。为了理解尺度应该如何沿着轨迹变化,我们首先分析终端损失对循环更新尺度的敏感性。我们表明,其时间平均值可以精确分解为持续进步和中心波动贡献。基于此,我们引入了轨迹自适应进度波动调度器(TAPS),它跟踪它们在周期性更新中的平衡并在线调整步长。理论上,我们建立了充分的条件,在该条件下 TAPS 可以减少预期的终端损耗并以更少的循环次数达到目标质量。根据经验,我们表明 TAPS 无需重新训练即可提高结构化推理任务的终端准确性。通过进一步将进度波动原理融入训练中,TAPS 可以在匹配的基线精度下实现额外的精度增益,挂钟加速高达 1.56 倍。 TAPS 的广泛适用性得益于其在不同循环架构和推理策略中的有效性。总之,这些结果将更新规模确立为与架构和深度一起的循环推理的补充控制轴。