论文

MAPL:机器人运动的多目标偏好学习

MAPL: Multi-Objective Preference Learning for Robot Locomotion

模型训练奖励建模与过程监督

摘要

奖励设计仍然是机器人运动强化学习的主要瓶颈,其中成功的策略通常取决于精心调整的、针对特定任务的奖励函数。基于偏好的强化学习提供了一种替代方案,但现有的基于 LLM 的方法通常要求对行为之间进行单一的整体判断,这使得很难捕获高质量运动背后的多个竞争目标。我们提出了多目标人工智能知情偏好学习(MAPL),这是一个从高级自然语言目标而不是手动设计的奖励方程中学习运动奖励的框架。 MAPL 提示 大语言模型 使用地形不变且几乎不需要领域专业知识的通用语言描述,根据语义上有意义的标准独立比较轨迹。这些客观偏好用于训练多头偏好评分模型,其输出被聚合以形成策略优化的标量奖励。在四个四足运动环境中,MAPL 仅使用 LLM 生成的偏好来训练策略,并实现与专家设计的奖励相当或更好的性能,同时消除特定于任务的奖励工程。