论文
PlanPO:面向多轮Agentic LLM的组规划感知策略优化
PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs
摘要
组相对策略优化已成为在多轮交互任务上训练智能体大语言模型(LLM)的关键范式。然而,大多数现有变体无法区分成功轨迹之间的优势差异,即使这些轨迹在交互效率上相差悬殊。例如,绕远路取得的成功常被赋予与高效成功完全相同的结果奖励,导致优势坍缩和严重的性能瓶颈。为此,我们提出组规划感知策略优化(PlanPO),一种简单而有效的RL方法,用于学习超越任务特定高质量行为模式的可泛化规划能力。具体而言,PlanPO引入由粗到细的优势信号,在为同一任务采样到的成功轨迹条件下,捕捉轨迹级长度与轮级响应长度的相对差异。在组相对优化结构内,这使智能体能够从高质量rollout中主动学习覆盖交互规划与文本生成的可泛化、深思熟虑的行为,而不会退化为朴素的长度最小化。实验上,PlanPO在具有挑战性的多轮基准ALFWorld、WebShop和SciWorld上平均比GRPO提升27.2%,超越近期强大的基线方法,同时带来的额外训练成本可忽略。
