论文
RDA:强化学习的奖励设计代理
RDA: Reward Design Agent for Reinforcement Learning
摘要
强化学习使机器人能够获得令人印象深刻的技能,但通常需要手工设计的奖励函数,这些函数设计缓慢且难以与人类意图保持一致。最近的工作,例如 Eureka,通过使用 LLM 从任务描述中迭代生成和完善奖励代码来自动化奖励设计。然而,它们依赖于成功率等粗略的反馈信号,而这些信号几乎无法提供对学习行为的语义洞察。因此,他们训练有素的政策实现了最终目标,但往往与任务指令不一致。我们介绍了奖励设计代理(RDA),这是一个基于 VLM 的代理框架,它将语义理解注入奖励设计中。 RDA 分解任务,直观地评估轨迹,总结失败模式,并迭代修改奖励代码以更好地与任务指令保持一致。在 ManiSkill 的 12 个桌面操作任务和 HumanoidBench 的 4 个全身操作任务中,RDA 生成的策略比其他基线的指令更加一致,同时实现了可比的任务成功率。视频和生成的奖励代码可在 https://nitinkamra1992.github.io/reward-design-agent 上找到。