论文
MimicAgent:通过提示轨迹生成获得四足技能
MimicAgent: Quadruped Skills via Prompt-to-Trajectory Generation
摘要
我们提出了 MimicAgent,一个用于学习动态四足动物技能的提示轨迹生成框架。尽管奖励塑造在训练四足策略时被广泛使用,但驾驭由此产生的奖励环境是出了名的困难,需要数小时的“研究生血统”。尤里卡试图通过大语言模型实现奖励设计的自动化,但我们发现它很难概括不同的技能和形态。我们的主要观察结果是,对于人类(以及大语言模型)来说,生成参考动作比塑造奖励函数要容易得多。我们的假设是基于示例引导的类人强化学习的成功,它利用大规模运动捕捉数据集作为训练运动策略的参考。与类人动物不同,四足动物缺乏此类参考运动数据。为此,我们提出了 MimicAgent,一种代理工具,在给出技能提示的情况下,使用编码代理生成四足参考轨迹。然后,使用这些粗略参考轨迹来训练可在模拟和现实世界中部署的示例引导的强化学习策略。值得注意的是,我们发现,当在我们的代理工具中提示 Claude Fable 5.1 时,87% 的提示会产生语义上对齐的参考轨迹。