论文

通过成功访问匹配进行学习过程奖励以实现高效强化学习

Learning Process Rewards via Success Visitation Matching for Efficient RL

模型训练奖励建模与过程监督

摘要

在强化学习 (RL) 的许多现代应用中,感兴趣的任务的自然奖励本质上是稀疏的:除了任务完成时给予 +1 的奖励之外,到处都给予 0 奖励。训练一个策略来最大化这种稀疏的奖励需要解决具有挑战性的贡献分配问题,从而导致 RL 改进缓慢或无效。我们提出了一种简单的方法,将稀疏的结果奖励转化为密集的过程奖励。我们的方法依赖于训练一个判别器来区分之前成功和不成功的事件,并使用这个判别器来激励 RL 学习的策略来匹配成功事件的状态操作访问,同时避免不成功事件的状态操作访问。通过激励政策匹配所有状态的访问,而不仅仅是那些与任务成功相对应的访问,这种奖励提供了关于任务完成是否取得进展的密集反馈,并且我们证明,可以在不改变最优政策的情况下实现这一目标。我们重点关注机器人控制策略的微调,证明与简单地最大化稀疏结果奖励相比,我们的方法可以在模拟和现实世界的操作任务上显着加快 RL 微调性能。