论文

内部物流中上下文语义映射的视觉语言模型推理

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

应用与实践视觉感知与空间理解

摘要

在内部物流环境中运行的自主移动机器人依靠几何地图进行定位和导航,但缺乏对对象及其上下文属性的语义理解。我们提出了一种上下文语义映射管道,它结合了基于 SLAM 的几何映射、基于 SAM 的实例分割、实例聚类和 VLM 多视图推理,以生成编码几何结构、对象类和对象可移动性的上下文语义映射表示。通过聚合多个视点的观察结果并在零样本、开放词汇设置中查询 VLM,该管道可以推断上下文对象属性(此处通过可移动性进行演示),而无需特定于任务的训练或预定义的对象类别。我们在两种提示策略下评估了三个 VLM,并对管道进行了组件分析。所提出的流程在语义分类方面实现了 98.93% mIoU,在对象可移动性估计方面实现了 89.17% mAcc。组件分析将 VLM 推理确定为上下文理解的主要瓶颈,将实例集群确定为全景性能的主要限制。生成的语义地图支持动态内部物流环境中的上下文感知过滤和稳健导航。