论文

UrbanGround:从本地感知到真实规模城市的空间机构

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

智能体系统Agent任务评测

摘要

多模态 大语言模型 (MLLM) 可以解释街景,但可靠的城市行动取决于智能体开始移动后此类本地证据是否仍然有用。在本文中,我们研究了当前 MLLM 代理在多大程度上可以将本地城市感知转化为真实规模城市中的可靠行动。我们提出了 UrbanGround,这是一个根据香港全港 3D 地理空间数据构建的城市沙箱。它通过共享评估界面将城市的地理结构与连续的、碰撞约束的控制结合起来。代理使用第一人称观察和交互式地图来选择跨任务的操作,从本地问答到长视野导航。我们的分析通过三个研究问题来跟踪空间问题的发展。我们首先测试智能体是否可以收集和解释局部视觉证据来回答空间问题。然后我们询问当目的地变得更远且不那么明确时,这些能力是否支持导航。最后,我们检查由此产生的行为是否能够承受路线可用性和行人运动的变化。 MLLM 智能体通常在视觉识别和短程空间推理方面表现出有用的原子能力,而方向和行人感知运动仍然不可靠。他们的核心失败出现在长期探索中,局部能力无法形成持续的目标导向行为,并且错误会在没有有效纠正的情况下累积。我们希望 UrbanGround 能够支持更广泛的研究,研究 MLLM 智能体在开放式城市环境中可靠探索的程度。