论文
SAGP:通过粗区 VLM 推理进行语义可供引导的掌握规划
SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning
摘要
基于几何的抓取规划器可确保物理上有效的抓取,但忽略功能语义,通常会生成相反且无碰撞但实际上不合适的抓取,例如,抓住杯子的边缘、抓住刀刃或靠近瓶盖的瓶子。即使满足传统的掌握指标,这些不一致也会导致下游任务失败。现有的视觉语言模型(VLM)方法要么依赖于细粒度、特定于类别的部分分割,要么尝试直接推断抓取姿势,后者容易产生空间幻觉。因此,尚未提出实用的 无需训练 框架来将高级语义推理与几何掌握规划稳健地联系起来。我们引入了语义可供引导的掌握规划(SAGP),这是一个构建在粗区抽象层上的 无需训练 管道。该方法首先通过应用基于 PCA 的对齐,然后进行距离驱动的 DBSCAN 聚类,将对象点云划分为空间区域(顶部、中间、底部、侧面和突起),完全绕过学习分割。然后,预先训练的 VLM 通过结构化零样本查询评估每个区域的抓取质量,并将所得的区域分数与几何、可达性和任务对齐信号融合,以对反足抓取候选者进行重新排序。使用 Franka Panda 机器人对 PyBullet 中的 YCB 对象进行的实验表明,SAGP 保留了仅几何规划的高成功率,同时大大提高了所选抓取的功能适当性,特别是在仅几何形状无法提供信息的不对称、带有手柄的对象上。引入的粗区抽象在基于 VLM 的推理和几何掌握规划之间提供了有效的 无需训练 桥梁,而不需要细粒度的零件分割。