论文

PlanPO:面向多轮Agentic LLM的组规划感知策略优化

PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs

模型训练强化学习RLVRAgentic RL

摘要

组相对策略优化已成为在多轮交互任务上训练智能体大语言模型(LLM)的关键范式。然而,大多数现有变体无法区分成功轨迹之间的优势差异,即使这些轨迹在交互效率上相差悬殊。例如,绕远路取得的成功常被赋予与高效成功完全相同的结果奖励,导致优势坍缩和严重的性能瓶颈。为此,我们提出组规划感知策略优化(PlanPO),一种简单而有效的RL方法,用于学习超越任务特定高质量行为模式的可泛化规划能力。具体而言,PlanPO引入由粗到细的优势信号,在为同一任务采样到的成功轨迹条件下,捕捉轨迹级长度与轮级响应长度的相对差异。在组相对优化结构内,这使智能体能够从高质量rollout中主动学习覆盖交互规划与文本生成的可泛化、深思熟虑的行为,而不会退化为朴素的长度最小化。实验上,PlanPO在具有挑战性的多轮基准ALFWorld、WebShop和SciWorld上平均比GRPO提升27.2%,超越近期强大的基线方法,同时带来的额外训练成本可忽略。

PlanPO:面向多轮Agentic LLM的组规划感知策略优化:论文配图
图1:左:成功的 rollout 并非同等地富含信息。达到同一任务目标的 rollout 在长度、直接性与推理质量上可能差异巨大,而最优的策略可能揭示更精细、更可泛化的能力。右:使用 Qwen2.5-1.5b 模型在 ALFWorld、WebShop 与 SciWorld 环境上的平均归一化性能比较。