论文
GROW²:为机器人工具使用定位“选哪件”与“用哪里”
GROW$^2$: Grounding Which and Where for Robot Tool Use
摘要
如果没有刀,机器人可以用盘子切蛋糕吗?工具的使用极大地扩展了机器人的能力,但要创造性地使用工具超出其预期功能,机器人面临$\textit{开放世界可供性基础}$的挑战:选择一个开放类别对象作为工具并定位其特定的动作区域。为此,我们引入了 GROW$^2$ (GROounding Which andWhere),它利用对象部分作为自然抽象,将定位过程分层划分为语义和几何级别,从而绕过数据密集型端到端训练的需要。从语义上讲,GROW$^2$ 利用视觉语言模型(VLM)的常识推理来解析自然语言任务指令,选择合适的对象作为工具,并识别工具和目标对象上与任务相关的部分。从几何角度来看,视觉基础模型随后将选定的部件从单个 RGB-D 图像中磨成精确的 3D 区域。对既定基准的实验表明,GROW$^2$ 在可供性预测基准上优于最先进的基准。此外,它实现了对开放类别对象的零样本泛化,并且在模拟和现实世界的机器人工具使用实验中都优于基线。