论文
CoDex:无需演示即可学习组合灵巧功能操作
CoDex: Learning Compositional Dexterous Functional Manipulation without Demonstrations
摘要
在这项工作中,我们研究组合灵巧功能对象操纵(CD-FOM):诸如瞄准并启动植物上的喷雾瓶或木材上的胶枪等任务,这些任务既需要启动对象的内部机制,又需要控制其姿势,以将对象的功能应用于环境。这些任务对机器人提出了重大挑战,因为需要将对象功能、驱动模式和应用领域的语义理解与复杂的身体灵活性相结合,以管理抓取稳定性、运动轨迹和驱动。我们引入了 CoDex,一个零演示框架,可以自主发现 CD-FOM 操作策略。 CoDex 使用视觉语言模型 (VLM) 从任务和场景推断语义约束。这些约束指导分析约束优化,以生成功能抓取候选的简短列表,可以通过强化学习有效地细化这些候选列表,以生成可从模拟转移到现实世界的完整抓取-移动-驱动策略。我们在带有 16 自由度多指手的 7 自由度机器人臂上评估 CoDex,执行 6 个 CD-FOM 任务,涉及以前未见过的具有内部机制的物体,包括喷雾瓶、热胶枪、空气除尘器、手电筒和胡椒研磨机,以及它们在未见过的目标物体上的应用,展示了其在无需人类演示的情况下自主发现和执行复杂的、物理上可行的灵巧行为的能力。更多信息请访问 https://robin-lab.cs.utexas.edu/CoDex/。