论文
随心所欲地抓取:从生成的人类演示中模仿功能性抓取
Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations
摘要
由于物体和任务的多样性,构建能够在日常开放世界环境中执行功能性抓取的多面手机器人仍然是一项重大挑战。现有的方法要么局限于狭窄的对象/任务集,要么依赖大规模的数据收集来捕获现实世界的变化。在这项工作中,我们提出了一种替代方法 GraspDreamer,该方法利用视觉生成模型(VGM)(例如视频生成模型)合成的人类演示来实现零样本功能抓取,而无需劳动密集型数据收集。关键思想是,在互联网规模的人类数据上预先训练的 VGM 隐式编码了关于人类如何与物理世界交互的广义先验,这可以与特定于实施例的动作优化相结合,以最小的努力实现功能性抓取。使用不同机器人手在公共基准上进行的大量实验表明,与之前的方法相比,GraspDreamer 具有卓越的数据效率和泛化性能。真实世界的评估进一步验证了真实机器人的有效性。此外,我们还展示了 GraspDreamer 可以(1)自然地扩展到下游操作任务,(2)可以生成数据来支持视觉运动策略学习。