论文

从可行的失败前缀中学习:长期 LLM Agent的里程碑可行性潜在策略优化

Learning from Viable Failure Prefixes: Milestone Viability Potential Policy Optimization for Long-Horizon LLM Agents

模型训练强化学习RLVRAgentic RL

摘要

长期 LLM 智能体需要强化学习方法,可以在稀疏和延迟奖励下将功劳分配给中间决策。现有的基于组的方法(例如 GRPO 和 GiGPO)通过比较rollout回报或重复锚定状态来缓解此问题,但当比较的回报没有变化时,它们仍然会失败。我们将这种失败模式识别为零信用失败:在早期训练期间,许多失败的部署包含有用的前缀,但现有方法没有为它们分配任务区分优势。为了解决这个问题,我们提出了里程碑可行性潜在策略优化(MVPO),这是一种从可行的失败前缀中学习的潜在路由策略优化算法。 MVPO估计Union-Find生存区域的前缀潜力,修复具有潜在差异优势的零信用组,并根据相对性能进展衰减潜在分支。 Qwen2.5-1.5B-Instruct 的实验表明,MVPO 的性能优于 GRPO 和 GiGPO 等八个强基线。在相同的训练长度下,MVPO 在 ALFWorld 上比 GiGPO 基线提高了 +4.4 个成功点,在 WebShop 上提高了 +5.3 个成功点,同时仅增加了 0.16%-0.20% 的优势构建开销。