论文

我的错误:自我诊断作为自我进化中的信用分配 Agentic 强化学习

My FAULT: Self-Diagnosis as Credit Assignment in Self-Evolving Agentic Reinforcement Learning

模型训练奖励建模与过程监督

摘要

Agentic 强化学习 (RL) 已成为在多步骤任务上训练大语言模型Agent的强大方法,但对最终结果奖励的依赖会产生两个信用分配问题,特别是在长期任务中。首先,相同结果的rollout组没有从最终奖励中提供学习信号。其次,终端奖励仅提供轨迹范围内的反馈,因此很难确定哪些决策导致了失败。最近的工作通过轨迹分析中的更细粒度的信息补充了终端奖励,例如对中间决策和错误的自然语言反映。然而,自然语言诊断很难直接用于学分分配:它们的错误声明可能不可靠,并且它们没有量化每个错误对学习的影响程度。我们提出自我诊断引导的终端信用重新分配(FAULT),它将诊断错误转化为以终端结果为锚定的明确的步骤级信用。 FAULT 检查诊断证据并从任务结果中了解相对错误成本。在训练过程中,策略和自我诊断器共同发展,而错误成本则根据最近的结果在线更新。在 ALFWorld 上,FAULT 从相同结果组中恢复学习信号,达到 95% 的信号覆盖率,而 GRPO 为 41%,GiGPO 为 72%,同时更好地将功劳定位到特定错误步骤。在两个模型规模上,FAULT 表现强劲。对长期 ALFWorld 和 WebShop 任务的改进,同时在短期基于搜索的 QA 上保持竞争力。