论文

迭代奖励设计的鸟瞰图

A Bird's-Eye View of Iterative Reward Design

模型评测基准与评测资源

摘要

在强化学习中设计有效的奖励函数通常需要大量的专业知识和反复试验。最近的工作使用基于LLM的系统自动化了这一过程,该系统使用策略反馈生成并迭代改进奖励代码。然而,这些方法通常很难比较,因为它们在实现细节、反馈假设和评估环境方面有所不同。为了解决这个问题,我们引入了迭代奖励设计(BIRD)基准,它在统一的配置和评估空间中表达现有方法。这使我们能够直接比较算法,消除单独的设计选择,并在匹配的反馈条件和策略-训练预算下制作新组件的原型。在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 中,我们确定了一小部分简单的设计选择,可以持续提高性能。结合这些选择可以产生比之前工作中评估的方法明显更好的性能。我们的结果强调了简单基线的优势,并激励进一步研究额外的算法复杂性何时可以改善迭代奖励设计。代码可在 https://github.com/safety-research/bird. 获取

迭代奖励设计的鸟瞰图的原论文方法或结果图
图 2:Eureka 在 Meta-World 按钮按下任务上的一次迭代。 LLM生成8个奖励函数,全部通过验证。每个奖励用于训练 PPO 策略 1M 环境步骤。奖励 $A$ 产生最好的策略 (89% 任务成功率),而 $H$ 产生最差 (0%)。 Eureka 贪婪地保留了 $A$,并向LLM提供有关其奖励组件(例如,触及、按下和中心)在训练期间如何演变的反馈。 LLM使用此反馈将 $A$ 修改为 $A^{\prime}$。所有结果均来自实际运行。