论文
VLM 可以描述,但不能测量:用于机器人操作的以对象为中心的场景理解
VLMs Can Describe, But Not Measure: Object-Centric Scene Understanding for Robotic Manipulation
摘要
在以前未见过的环境中进行机器人操作需要语义理解和可靠的度量信息。虽然视觉语言模型 (VLM) 提供了强大的语义功能,但它们的几何估计仍然不太可靠。在本文中,我们提出了一种 VLM 驱动的模块化感知框架,使用现成的方法进行场景理解。从单个 RGB-D 观察开始,场景被分割为对象级区域,由 VLM 进行注释,并以深度信息为基础,构建与任务无关的以对象为中心的表示。对 151 个桌面场景进行的实验表明,所提出的分解保留了强大的语义性能,同时比直接 VLM 推理大幅改进了定位和深度估计。生成的表示还与机器人执行的任务规划框架集成。