论文

RELACE:长任务语言 Agent 的回顾似然信用估计

RELACE: retrospective likelihood-based action credit estimation for long-horizon language agents

模型训练强化学习

摘要

组相对策略优化 (GRPO) 通过估计 执行轨迹 组的优势来避免单独的批评。然而,对于多轮智能体,轨迹级监督提供了粗略的、嘈杂的信用:终端奖励不能定位错误,并且可以惩罚有用的行为和错误。组中策略优化 (GiGPO) 和后续方法通过状态条件比较来完善监管,但它们的信用估计仍然对下游决策和结果敏感。我们引入了 RELACE(基于回顾似然的行动),这是一个无批评的框架,它将回顾行动评估与状态条件优势估计相结合。 RELACE 通过 教师模型 强制可能性评分在原始上下文和结果增强上下文下评估执行的操作。比较这些可能性会产生一个轨迹归一化的回顾性因素,该因素捕获行动合理性中依赖于结果的变化,而不仅仅是事后的合理性。我们使用这个因素来重新加权折扣任务回报,并通过比较任务中等效状态的操作之间的加权回报来构建局部优势。这将回顾性相关性与观察到的奖励结合起来,产生细粒度的信用,补充轨迹级 GRPO 监督。时间平滑和成功保护掩蔽进一步稳定了本地信号。 RELACE 既不需要辅助价值模型,也不需要奖励模型,也不需要额外的自回归 执行轨迹 来进行信用评估。使用 Qwen2.5-1.5B-Instruct 和 Qwen2.5-7B-Instruct 在 ALFWorld 和 WebShop 上进行的实验表明,相对于 GRPO、GiGPO 和 HCAPO,有显着改进。凭借 1.5B 模型,RELACE 在 ALFWorld 上取得了 $96.35\%$ 的成功,在 WebShop 上取得了 $79.43\%$ 的成功,分别超越了 GiGPO $5.47$ 和 $5.60$ 个百分点。