论文
SLPO:通过替代策略扩展潜在推理
SLPO: Scaling Latent Reasoning via a Surrogate Policy
摘要
具有可验证奖励的强化学习已成为在显式思想链推理器中引发测试时间扩展的主要方法。然而,这种扩展路径的计算成本仍然很高,因为每个中间步骤都必须解码为语言标记。相反,潜在推理将中间计算作为连续向量进行,并且在更短的范围内已经匹配或超过了显式 CoT。尽管有这样的承诺,潜在推理机在很大程度上仍然受到模仿的束缚,而显性 CoT 已经通过结果奖励 RL 超越了模仿。潜在轨迹缺乏可处理的每步可能性和固定思维预算下的自适应停止界面,因此结果奖励无法引发潜在的测试时间缩放。我们引入了替代潜在策略优化(SLPO),将结果奖励强化学习引入自回归潜在推理器:轨迹级信用分配的潜在转变上的经验替代策略密度,以及将结果奖励优化细化为可变范围策略的正确性监督停止头。在连续和软思维设置中,SLPO 改进了并行采样下的 Pass@$k$,并将更长的潜在计算分配给具有更高确定性精度的更困难的实例。