论文

奖励信念,而不是行动:长期代理的一致性引导贡献分配

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents

模型训练强化学习Agentic RL

摘要

可验证奖励的强化学习 (RLVR) 是改进 大语言模型 (LLM) 智能体长期交互任务的有前途的范例。然而,在部分可观察的环境中,不完整的观察会导致代理信念随着时间的推移而漂移,而延迟的奖励掩盖了中间决策的因果影响,加剧了时间贡献分配的挑战。为了解决这个问题,我们提出了 ReBel(奖励信念),这是一种过程级强化学习算法,它显式地建模结构化信念状态,以总结交互历史并指导后续的策略学习。 ReBel 引入了信念一致性监督,将预测信念和观察到的反馈之间的差异转换为密集的自我监督信号,而不需要外部逐步注释或验证器。它还采用信念感知分组来比较相似信念状态下的轨迹,从而产生更稳健和更低方差的优势估计。我们根据具有挑战性的长期基准(包括 ALFWorld 和 WebShop)对 ReBel 进行评估。与情节级基线 GRPO 相比,ReBel 将任务成功率提高了高达 20.4% 个百分点,并将样本效率提高了 2.1 倍。这些结果表明,信念意识自我监督是部分可观察性下可靠的长期决策的一个有前途的方向。代码位于:https://github.com/Fateyetian/Rebel.git。