论文
通过语义多样化探索实现强化高效推理
Reinforced Efficient Reasoning via Semantically Diverse Exploration
摘要
可验证奖励强化学习(RLVR)已被证明能有效提升大语言模型(LLM)的推理能力。基于蒙特卡洛树搜索(MCTS)的扩展方法通过提供树状推理 rollout 实现细粒度、段级的贡献归因,从而改进朴素 RLVR(如 GRPO)。然而,现有方法仍存在探索多样性受限和推理效率不高的问题。为应对上述挑战,我们为大模型提出通过语义多样化探索实现强化高效推理的方法,即 ROSE。为鼓励更多样的推理探索,我们的方法引入了基于语义熵的分支策略和 ε-探索机制:前者在已采样的推理 rollout 上运行,捕获语义不确定性并选择语义分歧高的分支点来生成新的后续推理路径;后者随机地从根节点发起推理 rollout,防止搜索过程变得过度局部化。为提升效率,我们设计了长度感知的段级优势估计器,奖励简洁且正确的推理,同时惩罚不必要的冗长推理链。在多种数学推理基准上使用 Qwen 和 Llama 模型的大量实验验证了 ROSE 的有效性和效率。代码发布于 https://github.com/ZiqiZhao1/ROSE-rl。
