论文
SeededGrasp:具有多种实施例的复杂场景中的语言引导抓取
SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
摘要
复杂场景中的实际机器人抓取需要 3D 空间推理并符合特定任务的要求。视觉语言模型 (VLM) 提供了一种使用语言来指定这些要求的自然方法,但现有方法要么使用 VLM 在有限的空间感知下直接预测抓取,要么将 VLM 与抓取模型一起训练,这需要更多的数据和计算。这些限制阻碍了性能并且阻碍了在复杂场景中扩展到多个实施例。我们通过提出 SeededGrasp 来解决这个问题,这是一种新颖的数据高效框架,使 VLM 能够预测种子点,并将其用作后续轻量级抓取生成模型的条件。我们的架构将高层语义推理与底层几何执行解耦,从而实现多实施例支持,同时绕过昂贵的端到端训练的需要。为了训练此类模型,我们发布了第一个多实施例桌面抓取数据集,其中包含杂乱场景中超过 250 万个抓取数据。实验结果表明,我们的方法优于现有基线,在模拟中取得了 72% 的成功,在现实世界的抓取实验中取得了 78% 的成功。请参阅我们的项目网站以获取数据和代码:https://uoft-isl.github.io/seeded-grasp/