论文

CompassAD:功能竞争对象中的意图驱动 3D 可供性基础

CompassAD: Intent-Driven 3D Affordance Grounding in Functionally Competing Objects

应用与实践视觉感知与空间理解

摘要

当被告知“切蛋糕”时,机器人必须选择刀而不是附近的剪刀,尽管这两种物体都提供相同的切割功能。在现实场景中,多个对象可能共享相同的可供性,但只有一个对象适合给定的任务上下文。我们称这种情况为混淆对。然而,现有的 3D 可供性方法通过评估孤立的单个对象(通常在查询中提供明确的类别名称)在很大程度上回避了这一挑战。我们形式化了意图驱动的可混淆可供性基础,这是一种新的 3D 可供性设置,需要预测多对象点云中正确对象上的每点可供性掩模,以隐式自然语言意图为条件。为了研究这个问题,我们构建了 CompassAD,这是第一个以令人困惑的多对象组合中的隐含意图为中心的基准。它包含 30 个令人困惑的对象对,涵盖 16 个可供类型、6,422 个组合以及 88K+ 查询-答案对。此外,我们提出了 CompassNet,一个包含两个专门针对此任务定制的模块的框架。实例边界交叉注入 (ICI) 将语言-几何对齐限制在对象边界内,以防止跨对象语义泄漏。双层对比细化 (BCR) 在几何组和点级别上强制进行区分,从而锐化目标表面和易混淆表面之间的区别。大量的实验证明了在可见和不可见的查询上的最先进的结果,并且在机器人操纵器上的部署证实了在令人困惑的多对象组合中有效地转移到现实世界的抓取。