论文

通过 VLM 引导的语义几何推理进行任务感知的双手可供性预测

Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning

摘要

双手操作需要推理在哪里与物体交互以及哪只手臂应该执行每个动作,这是一个联合可供性定位和手臂分配问题,如果没有对任务意图的语义理解,仅几何规划者就无法解决这个问题。现有方法要么将可供性预测视为粗略的部分分割,要么依赖几何启发式进行手臂分配,无法联合推理与任务相关的接触区域和手臂分配。我们将双手操作重新定义为联合可供性定位和手臂分配问题,并提出了一个用于任务感知双手可供性预测的分层框架,该框架利用视觉语言模型(VLM)来泛化对象类别和任务描述,而不需要特定于类别的训练。我们的方法将多视图 RGB-D 观察融合到一致的 3D 场景表示中,并生成全局 6-DoF 抓取候选对象,然后通过查询 VLM 来查找每个对象上与任务相关的可供性区域以及对各个对象的手臂分配,从而在空间和语义上过滤候选对象,从而在尊重任务语义的同时确保几何有效性。我们在双臂平台上评估我们的方法,涵盖九个真实世界的操作任务,涵盖四个类别:并行操作、协调稳定、工具使用和人工切换。我们的方法始终比面向任务的抓取的几何和语义基线实现更高的任务成功率,这表明对可供性和手臂分配的显式语义推理有助于在非结构化环境中实现可靠的双手操作。