论文
ZeroDex:通过多视图 三维定位 VLM 推理进行零样本长程灵巧操纵
ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning
摘要
我们推出了 ZeroDex,这是一种用于长程灵巧操作的零样本框架,它将语言指令从校准的多视图 RGB 图像中转化为可执行的 3D 任务计划。我们的系统不是训练端到端策略,而是使用视觉语言模型 (VLM) 来生成参考框架任务定位和原始级 2D 关键点,然后通过多视图融合将它们提升为 3D。这种提升将视图方向的 VLM定位结果的三角测量与参考视图射线投票相结合,后者沿着语义相机射线搜索相邻视图之间几何一致的候选者。由此产生的 3D 关键点支持拾取和放置和工具使用:对于工具使用,我们检索与推断的技能类别相对应的以对象为中心的原子动作,并将其存储的 6D 工具轨迹与场景对齐;为了灵巧执行,我们将提升的抓握关键点扩展到任务条件的抓握可供性区域,并使用手臂运动生成器生成可行的抓握运动对。真实世界的实验表明,与单视图 RGB-D 定位和微调的 VLA 基线相比,3D 定位精度和执行可靠性得到了提高。我们通过闭环状态验证和重新规划进一步演示了长程操纵,从而能够在新颖场景中对看不见的对象和工具使用任务进行零样本执行。