论文

SAPO:面向Agentic强化学习的单rollout自回归策略优化

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

Agentic强化学习(RL)已成为大语言模型后训练的关键阶段。现有的无评论家、组相对方法从多个rollout估计策略优势,避免了常规近端策略优化(PPO)的大量内存开销,并在长时程交互任务上取得强劲表现。尽管成功,近期研究揭示了三个局限:(1) 缺乏显式的价值泛化与有效的时序信用分配;(2) 在长时程复杂任务中可能出现优势坍缩;(3) 在采样预算与策略性能之间需要昂贵的权衡。本文提出单rollout自回归策略优化(SAPO),一个低内存且计算高效的框架,其中策略函数与价值函数共享单一自回归骨干。SAPO利用LLM的自回归结构,在共享参数下于不同的因果边界产生策略与价值预测,同时独立优化PPO目标与辅助的on-policy SARSA目标。为稳健估计每个回合的贡献,我们进一步引入结合lambda回报与批归一化的轨迹级广义优势估计器。在ALFWorld和WebShop上使用Qwen2.5-1.5B/7B的实验表明,SAPO训练稳定,平均比PPO和GRPO分别高出+15.1和+12.1个百分点,同时免除了单独评论家模型的内存成本,并将每轮迭代运行时间比PPO降低33.2%。项目页面:https://github.com/dy-liang/SAPO。

SAPO:面向Agentic强化学习的单rollout自回归策略优化:论文配图
图1:SAPO的框架。