论文
ROOT:发现用户指定的具体行为的奖励
ROOT: Discovering Rewards for User-Specified Embodied Behaviors
摘要
具身控制的强化学习仍然受到奖励规范难度的限制。尽管最近基于大语言模型 (LLM) 的方法可以从自然语言描述中合成奖励函数,但它们通常无法捕获人类关心的微妙行为属性,例如自然步态、姿势和运动风格。出现这种限制是因为许多期望的行为在视觉上比在奖励函数中编码更容易识别。我们引入了通过可观察树(ROOT)进行奖励优化,这是一个用于发现奖励函数的框架,该函数将学习到的策略与用户指定的具体行为相结合。 ROOT 不是仅仅依赖于标量训练统计数据,而是将奖励设计视为对持久实验树的观察引导搜索,该实验树存储奖励计划、经过训练的策略和执行轨迹观察结果,以及通过视频语言模型提取的行为见解,以诊断行为失败并指导后续的奖励细化。我们在四个实施例的七个任务上评估 ROOT:模拟的 Hopper、HalfCheetah、Ant、Unitree Go2 以及现实世界的 Unitree Go2。 ROOT 产生的行为比现有基于LLM的奖励生成方法生成的行为更符合用户意图,实现了高达 86.8% 的运动完整性准确性,并将 Vid-LLM行为一致性从 3.56/5 提高到 4.14/5,比基线提高了 16.5%。人类评估进一步支持了这些结果,在 51-63% 的成对比较中,ROOT 是首选。
