论文

将边界框作为目标:通过神经符号规划进行语言条件的掌握

Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning

摘要

为了将机器人有效地集成到家庭或工业环境中,机器必须实时适应自然语言提示。尽管视觉语言模型 (VLM) 已经实现了机器人任务和运动规划 (TAMP) 中的零样本泛化,但当前最先进的方法通常在计算上仍然是“重量级”,或者需要对数千个演示进行大量训练。我们提出了 GRASP(有视觉依据的推理和符号规划),这是一个旨在实现开放词汇桌面操作的框架。我们的方法利用预训练的 VLM 将自然语言查询转换为神经符号目标状态,通过边界框检测管道扎根于物理世界。与依赖固定颜色列表或硬编码坐标的方法不同,GRASP 使机器人能够解释抽象空间概念(例如“顶层货架”)并执行任务,而无需额外的 微调。我们在三个难度级别的 90 个真实机器人试验中取得了 73.3% 的总体成功率,无需针对特定任务的训练。