论文

长期 LLM 代理强化学习的粒度自适应学分分配

Granularity-Adaptive Credit Assignment for Long-Horizon LLM Agent Reinforcement Learning

模型训练强化学习Agentic RL

摘要

强化学习现在是在长期任务上训练大型语言模型代理的标准方法,其中数十个相互依赖的动作先于单个稀疏奖励。无批评、与群体相关的方法(例如 GRPO)适合这种制度,但它们向每一步广播一个轨迹级标量,并且无法说出哪个决策驱动了结果。 GiGPO 通过对共享锚状态的时间步进行分组来恢复步级信号,但它将步级和情节级估计合并在一个固定权重下,在关键分支决策上花费与常规的、近确定性转换相同的分辨率。我们认为正确的解决方案是依赖于状态的,并提出了 GACA,这是一种无批评估计器,其粒度遵循基于不确定性的关键性代理。 GACA 通过其自己的 rollout 已记录的负对数似然对每一步进行评分,然后将这两个优点与随该分数而增长的每步权重混合在一起,因此梯度将更多的权重放在高于平均 NLL 的细粒度信号和低于它的剧集级信号上。我们对所实施的混合进行了精确的风险分解,并表明足够小的调制可以改善正方向对齐下的固定混合。单独的条件结果使用预期 NLL 限制局部动作值变化,而误差投影分析则表征混合增加的值超出标量不确定性重新加权的情况。在 ALFWorld 和 WebShop 上,GACA 在 1.5B 和 7B 规模上都比 GRPO 和 GiGPO 提高了任务成功率。