论文

当更密集的信用还不够时:针对长期 LLM 代理训练的证据校准政策优化

When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training

模型训练强化学习

摘要

长视野 LLM 代理需要强化学习方法,可以在稀疏和延迟奖励下将功劳分配给中间决策。最近基于组的方法(例如 GiGPO)通过在重复锚定状态构建阶梯级优势来改进 GRPO。然而,我们表明,如此密集的信用在统计上可能是不可靠的:在有限的执行轨迹下,罕见但幸运的行动可能会获得过大的优势,产生发散的锚偏差和后期训练振荡。我们提出了证据校准策略优化(ECPO),这是一种无批评者的策略优化算法,可在策略更新之前校准步骤级信用。 ECPO 结合了证据校准行动优势(按规范行动对执行轨迹进行分组并缩小低计数估计)与方差门控信用权重(抑制行动内噪声主导的锚定状态)。使用 Qwen2.5-1.5B/7B 在 ALFWorld 和 WebShop 上进行的实验表明,ECPO 始终优于强基线,在使用 Qwen2.5-1.5B 的 ALFWorld/WebShop 上将 GiGPO 提高了 +5.2/+7.3 成功点,同时仅增加了 0.1% 的额外优势计算开销。