论文

面向智能体强化学习的进度与可靠性导向群组策略优化

Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning

模型训练强化学习Agentic RL

摘要

基于群组的强化学习(RL)已成为改进大语言模型智能体长程交互任务的有效范式。为获得比轨迹级优化更细粒度的策略更新——近期工作走向步级群组RL——中间步在rollout批次内被分组比较。但步级优势估计对群组形成方式敏感:按宽泛状态键分组改善覆盖——但可能比较不同历史下采取的动作;而强制历史一致性产生更公平比较——代价是群组碎片化与缺失同伴比较信号。本文中——我们提出ProGPO(进度与可靠性导向群组策略优化)——上下文一致步级学习的免学习评论家方法。ProGPO保持精确前缀动作比较——并用从rollout导出的状态势能获得的转移信用补充稀疏同伴比较。为可靠估计这些势能——ProGPO结合语义扩展与跨历史深度的逆方差融合。我们以Qwen2.5-1.5B-Instruct在ALFWorld与WebShop两个挑战性智能体任务上评估ProGPO。结果表明ProGPO在可比计算开销下超越匹配的智能体RL基线——额外的Qwen2.5-3B-Instruct实验进一步检验该方法的可扩展性。

面向智能体强化学习的进度与可靠性导向群组策略优化:论文配图
图 1:ProGPO 的动机。左:推出轨迹。中:按当前状态进行步骤级分组可以混合不同的历史记录。右:上下文一致的分组创建更小的对等组。