论文

通过带有进度指导的状态条件潜在转向进行高效推理探索

Efficient Reasoning Exploration via State-Conditioned Latent Steering with Progress Guidance

模型推理解码与生成控制

摘要

Best-of-$N$ 是一种广泛使用的复杂推理推理策略,其有效性取决于样本候选是否能够覆盖多样化且高质量的推理路径。然而,经过训练的推理模型经常会遭受\emph{探索崩溃}的困扰,其中独立的采样轨迹重复遵循类似的推理路径,并限制了增加轨迹采样预算所带来的收益。现有方法通过促进更广泛的探索来缓解这个问题,但没有明确引导探索取得有意义的进展,从而导致探索效率有限。为了解决这个问题,我们提出了 \emph{\underline{S}state-conditioned \underline{P}rogress-guided \underline{S}teering} (SPS),这是一种免训练的潜在转向框架。具体来说,SPS 构建了一个状态条件方向库,其中包含针对不同前缀状态区域的多个进度引导的转向向量。在在线推理过程中,SPS 根据当前前缀状态检索合适的引导向量,并将其应用于高不确定性转换,以指导下一个推理步骤取得有意义的进展。跨多个模型规模和基准的广泛实验表明,SPS 始终优于强大的基线。进一步的分析验证了其关键设计的有效性,并为未来的研究提供了宝贵的见解。该代码可从此 https URL 获取。