论文

SeeUPO:具有收敛保证的序列级Agentic-RL

SeeUPO: Sequence-Level Agentic-RL with Convergence Guarantees

模型训练强化学习Agentic RL

摘要

强化学习(RL)已成为训练基于大语言模型(LLM)的 AI 智能体的主流范式。然而,现有的主干 RL 算法在 Agentic 场景中缺乏经过验证的收敛保证,在多轮设置中尤其如此,这可能导致训练不稳定以及无法收敛到最优策略。本文系统分析了策略更新机制与优势估计方法的不同组合如何影响单轮/多轮场景下的收敛性质。我们发现,采用组相对优势估计(GRAE)的 REINFORCE 在无折扣条件下可以收敛到全局最优,但 PPO 与 GRAE 的组合破坏了 PPO 原有的单调改进性质。此外,我们证明主流主干 RL 算法无法在多轮场景中同时实现无评估器(critic-free)与收敛保证。为解决这一问题,我们提出 SeeUPO(Sequence-level Sequential Update Policy Optimization,序列级顺序更新策略优化),一种面向多轮交互、具有收敛保证的无评估器方法。SeeUPO 将多轮交互建模为按顺序执行的多智能体老虎机问题。通过按执行顺序的逆序逐轮进行顺序策略更新,它借助逆向归纳确保单调改进并收敛到全局最优解。在 AppWorld 与 BFCL v4 上的实验表明,SeeUPO 相对现有主干算法取得显著提升:在 Qwen3-14B 上相对提升 43.3%-54.6%,在 Qwen2.5-14B 上相对提升 24.1%-41.9%(跨基准平均),并具有更优的训练稳定性。

SeeUPO:具有收敛保证的序列级Agentic-RL
图1:在 AppWorld 与 BFCL-v4 基准上训练 Qwen3-14B 模型的性能比较。(a)-(b) 展示训练曲线,(c)-(f) 展示测试曲线。与其他骨干 RL 算法相比,SeeUPO 算法展现出显著更强的训练稳定性与最优的性能。