论文

视觉语言运动地图:3D 场景地图的开放词汇、不确定性感知、可查询运动属性

Vision-Language-Motion Maps: An Open-Vocabulary, Uncertainty-Aware, Queryable Motion Attribute for 3D Scene Maps

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 地图让机器人可以回答有关内容和地点的语言查询,但它们假设一个静态世界,无法回答有关场景元素行为方式的查询。我们引入视觉语言运动地图(VLMM),这是一种开放词汇、可语言查询的 3D 地图 - 通过基于规则的意图路由器对开放词汇对象名词进行查询,而不是一般的自然语言接口 - 其中每个元素都带有融合的运动属性:VLM/LLM 语义可移动性先验与几何观察到的跨帧运动以及每个元素的不确定性相结合。查询简化为属性过滤器,用于区分已看到移动的内容、可能移动但尚未移动的内容以及保持静止的内容。在具有精确 真值(AI2-THOR,三种场景类型)的受控模拟器基准测试中,我们通过消融显示模式字段是不可替代的:即使具有强大的特征,纯语义基线也无法进行运动查询,并且运动字段都不能替代另一个运动字段(先验不能回答“什么在移动”,观察到的运动不能回答“什么可以移动”)。在真实动态 RGB-D(TUM 和波恩,六个序列)上,我们展示了不确定性通道 - 我们与之前的融合运动工作的主要区别 - 持续提高移动与静态平均精度并减少虚假运动标志,并且它对估计(噪声)姿势具有鲁棒性。原始置信度未校准,但事后等渗校准达到了 0.10 的预期校准误差。 VLMM 是一种表示贡献:每个最接近的先验图至少缺少我们的组合提供的四个属性中的一个:开放词汇、语言可查询、融合先验和观察到的运动以及每个元素的不确定性。