论文
HuGo:用 LLM 生成和修正人形全身策略代码
HuGo: LLMs as Whole-Body Policy Code Designers for Humanoid Loco-Manipulation
摘要
为了让类人机器人在日常环境中发挥作用,它们必须执行一系列将运动和操作结合起来的任务。现有的方法通常通过奖励工程或演示,然后进行特定任务的训练来获得移动操作策略,这使得扩展到新任务的成本高昂。在这项工作中,我们提出了一种人形机器人操纵的分层方法,消除了这些每个任务的要求。 HuGo,人形策略代码生成,使用大型语言模型(LLM)从冻结的低级全身策略之上的任务描述生成可执行的闭环高级策略代码。给定任务、观察和命令规范,大语言模型用代码构建任务逻辑。然后,HuGo 使用数值轨迹和选定的视频帧来完善策略,以产生反馈和有针对性的代码更新。在五个模拟任务中,使用两种不同的低级策略,HuGo 的性能大大优于高级强化学习基线,并接近基于演示的基线的性能。我们在没有针对特定任务的奖励设计或演示收集的情况下实现了这种绩效水平。我们进一步演示了模拟生成的策略到硬件的零样本迁移,并表明将相同的细化循环应用于现实世界的部署可以进一步提高传输性能,而无需专家演示或策略再训练。项目网站是 https://iconlab.negarmehr.com/HuGo/
