论文
稳定循环动力学以实现循环语言模型中测试时可扩展的潜在推理
Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models
摘要
循环语言模型 (LoopLM) 通过深度递归实现高效的潜在推理,但表现出不可靠的测试时间缩放行为:性能通常在某个迭代深度达到峰值,然后随着进一步的递归而崩溃。通过潜在的动态分析,我们发现现有架构和策略的稳定性和有效性之间存在固有的权衡。通过将推理概念化为不确定性减少,我们提出在保持有效性的同时向稳定不动点收敛是一种有前途的方法。为此,我们提出了 STARS(稳定性驱动的循环缩放),这是一种约束潜在状态接近渐近稳定不动点的训练框架。这是通过高效的雅可比谱半径正则化和随机循环采样来实现的,使 STARS 能够最大限度地提高有效性,同时确保严格的稳定性。算术任务的实验表明,STARS 实现了可靠的测试时间缩放,并且在复杂的数学推理中,它大大减轻了随着递归深度增加而导致的性能下降,同时还提高了峰值性能。