论文
RSPO:多轮 LLM 代理的奖励交换政策优化
RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents
摘要
强化学习在训练 大语言模型 (LLM) 处理多轮交互任务方面具有巨大潜力。然而,在以稀疏结果奖励为特征的长视野、多轮任务中,由于信号的稀疏性和缺乏细粒度的反馈,直接使用结果奖励进行训练往往会导致收敛缓慢。此外,模型可能无法学习训练期间未采样的成功轨迹,从而限制其性能。相反,虽然采用定制的密集过程奖励可以提供更丰富的信号并加速收敛,但这些替代奖励可能会与 真值 结果奖励表现出潜在的不一致。这种不一致可能会使训练方向产生偏差,并最终降低模型的最终性能。在这项工作中,我们提出了奖励交换策略优化(RSPO),这是一种旨在利用密集过程奖励中的丰富信息来促进结果奖励训练的方法。 RSPO通过奖励交换机制,保证了采样轨迹的多样性,同时保证了优化目标与真实结果奖励的一致性,从而提升了模型的性能上限。我们对两个具有挑战性的代理基准测试 WebShop 和 ALFWorld 进行了广泛的实验。通过将我们的方法应用于各种强化学习算法(包括 GRPO、PPO 和 GiGPO),我们证明了 RSPO 在不同基线和基准上实现了一致的性能改进。