论文

SCOPE-RL:优化成功前后的推理路径

SCOPE-RL: Optimizing Reasoning Paths Before and After Success

模型训练奖励建模与过程监督

摘要

带有可验证奖励的强化学习 (RLVR) 使用稀疏的可验证最终答案奖励来优化 LLM。这种稀疏锚可靠地验证轨迹是否成功,但不提供关于产生轨迹的推理路径的直接反馈。在成功之前,在困难问题上取得的先决进展不会收到任何奖励信号;成功后,结果奖励无法区分组织良好的正确轨迹和冗余或局部有缺陷的轨迹。我们引入了 SCOPE-RL(具有流程效率的脚手架链优化),这是一个两阶段框架,可在保留 GRPO 更新的同时强化此锚点:自适应脚手架 RL 在成功之前在隐藏答案的子问题链上添加前缀分解的可验证奖励,质量感知流程 RL 在成功后应用正确性门控的流程形状奖励来细化正确的轨迹。经过专家验证的步骤质量评估协议可评估有用步骤密度、错误定位和超出最终答案准确性的词元效率。在接受 DAPO-Math 和 Big-Math 训练的 Qwen3-8B-Instruct 上,与仅结果 GRPO 相比,SCOPE-RL 将平均准确度提高了 11.2 pp,并将推理标记减少了 27.1%; GSPO 和 Qwen3-0.6B-Instruct 下的收益保持不变,表明奖励信号致密化是对政策更新级别 RLVR 进步的补充。代码和数据可在 https://github.com/tokencraft-lab/SCOPE-RL 获取。