论文
体现语义:空间场景图数据集和具身操作轨迹视觉语言模型的基准
EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories
摘要
空间基础仍然是机器人操作视觉语言动作(VLA)系统的一个关键限制。虽然当前的模型可以识别对象并遵循语言指令,但它们通常缺乏对象在空间中如何排列的明确表示,包括支持、包含、排序、遮挡和深度敏感关系。我们引入了 ImplementSemantic,一个空间场景图数据集和用于评估具身操作中的关系定位的基准。实施例语义将场景表示为有向对象-关系-对象三元组,其中每个三元组使用一组固定的关系指定有序对象对之间的空间关系。这种表示可以直接评估对象绑定、关系预测和空间一致性。该数据集包括使用低成本 SO101 机器人手臂收集的真实世界操作观察结果,以及用于研究实际机器人设置中的空间定位的生成场景图。为了提供受控验证,我们还引入了基于模拟器的 LIBERO 基准,在配对的第三人称和手腕视图中具有超过 60K 操作帧和超过 120K 特定于相机的场景图,其中 真值 关系是从 MuJoCo 几何、世界坐标、相机投影和可见性约束自动导出的。我们通过将场景图注入现有的 VLA 策略提示来进一步测试场景图是否可以改善下游控制。跨开源和商业 VLM 的实验表明,当前的模型通常可以预测合理的关系,但难以处理精确的深度感知和视点相关的空间结构。 EmbodySemantic 提供了一个统一的框架,用于诊断 VLM 感知中的空间定位并测试其对 VLA 操作的实用性。