论文

ProCredit:从结果奖励到代理强化学习中的进度信用

ProCredit: From Outcome Rewards to Progress Credit in Agentic Reinforcement Learning

模型训练强化学习

摘要

长期代理任务要求代理通过一系列工具调用来修改环境,成功与否取决于最终状态。标准配方在最后分配一个结果奖励,并比较同一任务的采样轨迹。因此,没有成功轨迹的组不会产生训练信号,失败的尝试无法通过它们距离完成的程度来区分,并且推进任务的回合与仅查询环境的回合获得相同的信用。先前的工作细化了从轨迹到步骤的比较单位,或者训练奖励模型来提供中间信号:前者仍然仅从最终成功中得出信号,而后者则用模型来估计它。我们观察到,决定成功的验收检查也可以在中间状态上运行,因此进展与结果一样可验证。我们提出 ProCredit,它将经过验证的进度转化为信用:它在每个回合后重新运行验收检查,通过进度的变化奖励该回合,并使用这些奖励在同一任务的尝试和轨迹内的回合之间分配信用。从 AppWorld 上三个尺度的 Qwen3.5 基础模型开始,ProCredit 在两个测试集上的每个尺度上的任务完成率均优于结果奖励基线和基于进度的基线,在 4B 时超出最强结果奖励基线 4.1 个百分点,并且第二个环境中的结果显示出相同的改进方向。消融表明,仅将最终进度添加到轨迹分数中并不能提高性能:收益来自于将进度计入发生转弯的位置。