论文
RoboSeg:通过单眼手相机进行机器人操作的在线部分级语义重建
RoboSeg: Online Part-Level Semantic Reconstruction for Robotic Manipulation via a Single Eye-in-Hand Camera
摘要
机器人操作需要感知系统来识别可操作的部件,例如手柄、边缘、触发器和工具提示,而不仅仅是对象类别或点云。本文提出了 RoboSeg,这是一种零件级语义重建系统,它将视觉语言模型 (VLM) 功能零件发现、异步在线 RGB-D 语义重建和面向任务的抓取生成联系起来,无需 CAD 模型或预扫描网格。 RoboSeg 在初始 RGB 观察上查询 VLM,以获得紧凑的功能部分提示,然后使用两个异步流进行扫描:用于 RGB-D 里程计和截断符号距离函数 (TSDF) 融合的高频几何线程,以及用于 SAM3 部分掩模的关键帧触发语义线程。投影掩模通过体素级时间投票融合成持久部分标记的点云; RoboSeg 使用此映射将 AnyGrasp 6-DoF 候选分配给语义部分,并选择与任务相关部分标签一致的抓取。与手动标记的对象相比,RoboSeg 的平均部分交集 (mIoU) 达到 83.4%;在跨四个对象和八个任务的 24 次试验物理试验中,选定的抓取在所有试验中都接触了所请求的部分,并实现了 21/24 组合任务成功。这些结果将 RoboSeg 描述为用于任务条件操作的语义索引层,并保留 AnyGrasp 作为建议生成器。