论文

回到定义:通过轨迹图估计步骤级优势以改进Agent强化学习

Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

基于分组的强化学习(RL)方法,如GRPO及其变体,已成为训练推理型与Agent型大语言模型(LLM)的主导范式。虽然其组归一化优势估计在响应层面是可靠的,但在步骤层面存在系统性偏差,因为粗粒度的轨迹级优势难以准确反映单个步骤的贡献(即失败的轨迹可能包含有价值的步骤)。重新审视RL的基础定义,我们注意到GRPO在单轮任务上的成功源于其优势估计策略遵循了基本定义:从同一状态采样的多个动作的平均奖励构成可信的状态价值估计。将这种忠实估计扩展到步骤级原则上要求从每个中间状态采样多个动作,这在逐状态层面成本过高。为缓解该问题,我们提出GRAFT(基于图的忠实步骤级信用分配框架),它将所有rollout轨迹嫁接为一张轨迹图,通过图上的Bellman迭代恢复节点状态价值,并按节点价值差为每条边分配信用。理论上,估计的步骤级优势忠实遵循RL的基本优势定义。为进一步确保步骤级优势估计的可靠性,我们进一步提出Graph GAE,将GAE扩展到轨迹图以降低状态价值估计偏差的影响。在一系列多轮Agent基准上的实验显示,相比GRPO取得一致增益,并优于近期的Agent RL算法。代码将在该https URL提供。

回到定义:通过轨迹图估计步骤级优势以改进Agent强化学习:论文配图
图 1:方法概览。给定每个提示的 N 条轨迹,GRAFT 将轨迹合并为轨迹图,随后通过 Bellman 迭代将终端奖励反向传播以估计各节点的状态价值。两个节点之间的状态价值差 γV(s(t+1)) − V(s(t)) 被指定为步级优势,这与标准优势函数的定义一致(见第 3.3 节)。