论文
大型多模态模型距离人类水平的空间行动还有多远?城市空域目标导向具身导航基准
How Far Are Large Multimodal Models from Human-Level Spatial Action? A Benchmark for Goal-Oriented Embodied Navigation in Urban Airspace
摘要
大型多模态模型(LMM)展现出强大的视觉-语言推理能力,但其空间决策与行动能力仍不清楚。本工作通过一个具有挑战性的场景——城市三维空间中的目标导向导航——研究LMM能否像人类一样实现具身空间行动。我们首先花费500多个小时构建了包含5,037个高质量目标导向导航样本的数据集,重点关注三维垂直动作与丰富的城市语义信息。随后,我们全面评估了17个代表性模型,包括非推理LMM、推理LMM、基于智能体的方法以及视觉-语言-动作模型。实验表明,当前LMM已展现初步的行动能力,但距离人类水平仍有很大差距。此外,我们揭示了一个有趣现象:导航误差并非线性累积,而是在关键决策分叉之后迅速偏离目的地。我们通过分析LMM在这些关键决策分叉处的行为来考察其局限。最后,我们通过实验探索了四个有前景的改进方向:几何感知、跨视角理解、空间想象与长期记忆。项目地址:https://github.com/serenditipy-AC/Embodied-Navigation-Bench。
