论文
移动机器人融合物理与地理空间知识理解场景
Physico-Geospatial Grounded Scene Interpretation for Mobile Robotics
摘要
深度学习的最新进展允许机器人代理与动态和非结构化环境进行交互。特别令人感兴趣的是通过使用物理感知机器学习模型、知识图来建模关系或时空和逻辑推理,将物理地理空间世界知识集成到此类系统中。在目前的工作中,我们引入了一种方法,通过将语义描述、OpenStreetMap 建筑数据和街道信息与从我们的传感系统获得的位置、时间和度量信息相集成,并使用 LLM 融合这些信息,来增强用于场景解释的预训练、未经修改的 VLM 的输出。我们将此概念应用于大学校园内的户外记录,在我们的试点评估集上,建筑物对应定位任务的 F1 分数为 0.83,道路表面对应定位的 F1 分数为 0.64。结果证明了所提出的解决方案提供基于物理地理空间的自然语言描述的概念能力。代码和结果可在 https://datahub.rz.rptu.de/hstr-csrl-public/publications/physical-geospatial-grounded-scene-interpretation 获取