论文
RewardWeaver:为长程交互Agent动态调整过程奖励
RewardWeaver: Long-Horizon Interactive Learning for Language Agents via Self-Evolving Reward Adaptation
摘要
具有可验证奖励的强化学习(RLVR)在可以可靠评估任务结果的领域推动了实质性进展,但由于终端反馈稀疏和信用分配困难,长期交互仍然具有挑战性。过程奖励提供更密集的监督,但与训练最相关的能力可能会随着策略的发展而改变:易于评估或经常存在缺陷的行为不一定是当前限制任务成功的瓶颈。我们引入了 RewardWeaver,这是一种用于长视野交互中语言Agent的自我进化奖励适应框架。 RewardWeaver 维护一个经过验证的能力空间,其中承认的 Rubric 的语义保持固定,并关闭策略优化、任务评估、失败归因和奖励适应之间的循环。在每个训练阶段之后,它对低结果轨迹进行基于结果的后向归因,聚合经常性和策略控制的能力瓶颈,并为下一阶段动态选择相应的过程奖励。现有能力空间未涵盖的反复出现的故障会触发单独的、受控的扩展程序。我们在 SOTOPIA、Amazon?HistoryPrice 和新构建的销售基准上评估 REWARDWEAVER。在社交互动、双边讨价还价和特定领域销售方面,REWARDWEAVER 建立了新的最先进 (SOTA) 结果。消融进一步证明了动态奖励分配、基于失败的归因以及承认能力的稳定语义的重要性。
