论文

通过语义多样化探索实现强化高效推理

Reinforced Efficient Reasoning via Semantically Diverse Exploration

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)已被证明能有效提升大语言模型(LLM)的推理能力。基于蒙特卡洛树搜索(MCTS)的扩展方法通过提供树状推理 rollout 实现细粒度、段级的贡献归因,从而改进朴素 RLVR(如 GRPO)。然而,现有方法仍存在探索多样性受限和推理效率不高的问题。为应对上述挑战,我们为大模型提出通过语义多样化探索实现强化高效推理的方法,即 ROSE。为鼓励更多样的推理探索,我们的方法引入了基于语义熵的分支策略和 ε-探索机制:前者在已采样的推理 rollout 上运行,捕获语义不确定性并选择语义分歧高的分支点来生成新的后续推理路径;后者随机地从根节点发起推理 rollout,防止搜索过程变得过度局部化。为提升效率,我们设计了长度感知的段级优势估计器,奖励简洁且正确的推理,同时惩罚不必要的冗长推理链。在多种数学推理基准上使用 Qwen 和 Llama 模型的大量实验验证了 ROSE 的有效性和效率。代码发布于 https://github.com/ZiqiZhao1/ROSE-rl。

通过语义多样化探索实现强化高效推理 配图
图 2:ROSE 框架概览。左图展示基于树的 rollout 结构。枢纽节点(Pivot nodes)指语义不确定性最高的节点,依据语义熵进行选择。rollout 流程详见 3.1 节。右图描绘优势估计流水线,包含三个阶段:(1) 节点价值赋值、(2) 片段优势估计与 (3) 长度感知校准。这些阶段在 3.2 节中详细描述。