论文
长期代理任务的进度条件组策略优化
Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks
摘要
基于组的策略优化已越来越多地用于通过比较组内的轨迹或步骤来训练来自稀疏结果奖励的 大语言模型 (LLM) 代理。然而,在困难的长期任务中,这种比较可能会受到抽样不平衡的影响:重复或低效的行动在策略的高概率区域占主导地位,而有用的状态改变行动仍然采样不足。这种不平衡产生了许多全部失败的采样轨迹组,其中结果奖励没有为纠正政策提供方向。这些影响共同形成了一个自我强化的信用陷阱:以失败为主导的抽样不会产生基于结果的修正,从而导致重复的低效行动持续存在。为了打破这个循环,我们提出了进度条件组策略优化(ProGPO),它仅当组中的所有样本都获得零结果奖励时才使用首次访问观察覆盖率。具体来说,在这些组中,ProGPO 为访问更多新状态的轨迹或步骤分配了更高的相对优势,因为达到新的观察结果是任务成功的先决条件。在两个具有挑战性的代理基准(ALFWorld 和 WebShop 以及 Qwen2.5-1.5/7B-Instruct)上进行的实验表明,ProGPO 持续改进基于组的基准,尤其是在困难任务上取得了很大的进步。