论文

熵门控潜在递归

Entropy-Gated Latent Recursion

模型推理测试时计算扩展

摘要

推理时间缩放已成为改进语言模型推理的主要杠杆,但现有方法从单一来源获得采样轨迹多样性:随机 词元级 采样。我们认为这种单轴采样空间从根本上是有限的,并确定了第二个完全确定性和互补的轴:层跨度$L$,在该层跨度$L$处,冻结模型的顶部解码器层在高不确定性标记处递归地重新应用。 $L$ 的不同选择会产生不同的采样轨迹,解决不同的问题子集,没有随机性。我们通过熵门控潜在递归(EGLR)实例化该轴,这是一个 无需训练 解码过程,它重新应用顶部 $L$ 层最多 $K_{\max}$ 迭代,直到下一个词元分布收敛。结合 $T$ 温度样本,EGLR 将单轴随机采样轨迹池转变为 $L\times T$ 笛卡尔采样空间,每次采样轨迹成本几乎相同。我们通过 $8$ 指令调整模型和 $6$ 数学推理基准来描述这个空间,并表明 $L$ 轴真正与温度互补:在带有 Qwen2.5-3B-Instruct 的 MATH-500 上,联合 $L\times T$ 预言达到 $91.6\%$,超出仅温度预言 ($83.4\%$) 和 $+10.4$ 个百分点超越仅层的预言($81.2\%$),确认两个轴捕获真正互补的问题。扩展的 rollout 池为任何消耗 rollout 的下游过程提供了更丰富的按提示候选,包括自我一致性、验证者的 best-of-$N$ 以及组相关 RL 训练 (GRPO),为不依赖随机噪声的推理时间扩展开辟了新方向。