论文
迭代奖励设计的鸟瞰图
A Bird's-Eye View of Iterative Reward Design
摘要
在强化学习中设计有效的奖励函数通常需要大量的专业知识和反复试验。最近的工作使用基于LLM的系统自动化了这一过程,该系统使用策略反馈生成并迭代改进奖励代码。然而,这些方法通常很难比较,因为它们在实现细节、反馈假设和评估环境方面有所不同。为了解决这个问题,我们引入了迭代奖励设计(BIRD)基准,它在统一的配置和评估空间中表达现有方法。这使我们能够直接比较算法,消除单独的设计选择,并在匹配的反馈条件和策略-训练预算下制作新组件的原型。在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 中,我们确定了一小部分简单的设计选择,可以持续提高性能。结合这些选择可以产生比之前工作中评估的方法明显更好的性能。我们的结果强调了简单基线的优势,并激励进一步研究额外的算法复杂性何时可以改善迭代奖励设计。代码可在 https://github.com/safety-research/bird. 获取
