论文

FunArt:从生成 3D 潜伏中解码功能结构和清晰度

FunArt: Decoding Functional Structure and Articulation from Generative 3D Latents

摘要

为了在人类环境中有效运行,机器人必须识别铰接物体,分割其可移动和交互部分,并估计其运动学模型。现有的铰接场景表示通常从观察到的交互中恢复运动学,而在静态扫描上操作的方法通常将铰接与功能交互元素解耦。我们提出了 FunArt,这是一个框架,它根据在单个静态配置中捕获的摆姿 RGB-D 观察结果构建关节感知的功能 3D 场景图。 FunArt 重建对象实例,将其融合几何直接转换为 TRELLIS.2 的 O-Voxel 表示,并利用其冻结、稀疏压缩 VAE 作为结构先验。基于查询的轻量级解码器将紧凑的对象级潜在特征与密集的表面对齐特征相结合,以联合分割可移动部件和功能交互元素,同时估计运动类型、轴、原点和范围。在 Articulate3D 数据集上,FunArt 在可移动部件分割、关节估计和功能元素分割方面实现了最先进的性能,无论是否有真实对象输入。在端到端设置中,它比最强基线高 1.5 AP_{50} 点(对于可移动部件)、2.8 AP_{50} 点(在联合原点和轴约束下)以及 6.7 AP_{50} 点(对于功能元素)。这些结果表明,生成 3D 潜伏编码可操作的结构线索,可以在物理交互之前初始化机器人感知和规划。