论文
GRPO-VPS:通过可验证的流程监督进行有效推理,增强组相关策略优化
GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning
摘要
具有可验证奖励的强化学习 (RLVR) 通过利用直接结果验证而不是学习奖励模型,提高了 大语言模型 (LLM) 的推理能力。在此范式的基础上,组相对策略优化(GRPO)消除了对批评模型的需求,但会受到中间步骤不加区别的贡献分配的影响,这限制了其识别有效推理策略的能力并导致过度思考。在这项工作中,我们通过探索模型在整个推理轨迹中对正确答案的信念,引入了一种无模型且可验证的过程监督。通过将生成分段为离散步骤并跟踪附加在每个分段边界的正确答案的条件概率,我们有效地计算可解释的分段进度测量,以完善 GRPO 的轨迹级反馈。这种方法可以实现更具针对性和样本效率的策略更新,同时避免了因昂贵的蒙特卡罗轨迹采样或辅助模型而产生的中间监督的需要。数学和通用领域基准测试的实验表明,不同模型中的 GRPO 均取得了一致的收益:在数学任务上,精度提高了 2.6 点,推理长度减少了 13.7%;在通用领域任务上,精度提高了 2.4 点,推理长度减少了 4%,表现出很强的泛化能力。