论文

面向智能体推理的可验证过程奖励

Verifiable Process Rewards for Agentic Reasoning

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

可验证奖励强化学习(RLVR)提升了大语言模型(LLM)的推理能力,但大多数现有方法依赖稀疏的结果级反馈。这种稀疏性给长程智能体推理带来贡献归因难题:一条轨迹可能包含许多正确的中间决策却最终失败,也可能包含缺陷决策却最终成功。在本工作中,我们研究一类可密集验证的智能体推理问题,其中间动作可由符号或算法判定器客观检验。我们提出可验证过程奖励(VPR),一个将此类判定器转化为密集轮级强化学习监督的框架,并在三种代表性设定中实例化:面向动态演绎的基于搜索的验证、面向逻辑推理的基于约束的验证,以及面向概率推断的基于后验的验证。我们进一步提供理论分析,表明基于验证器的密集奖励可通过提供更局部化的学习信号改善长程贡献归因,其收益取决于验证器的可靠性。实验上,VPR在各受控环境中优于结果级奖励和基于rollout的过程奖励基线,更重要的是,它还能迁移到通用与智能体推理基准,表明可验证的过程监督能够培养超越训练环境的通用推理技能。我们的结果表明,只要存在可靠的中间验证,VPR就是增强LLM智能体的有前景方法,同时也凸显了它对判定器质量的依赖,以及将其扩展到结构化程度较低、开放式环境的开放挑战。

面向智能体推理的可验证过程奖励:论文配图
图 1:长期推理的三种奖励设计。左:结果级奖励(OR)仅在轨迹末端触发,中间决策不被认可。中:基于推出的流程奖励通过额外的策略推出对每一步进行评分,提供密集的反馈,但具有有限样本噪声(黄色)。右:可验证过程奖励(VPR)针对特定任务的预言机验证者对每一步进行评分,产生密集且无噪音的轮级监督(绿色)。