论文

SpatialAct:探索 3D 场景中 VLM 代理的空间推理到行动能力

SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes

智能体系统Agent任务评测

摘要

人类可以毫不费力地感知空间布局、形成认知表征、推理空间关系,并将此类推理转化为日常 3D 环境中的行动。尽管最近的视觉语言模型(VLM)在以观察为条件的空间感知和推理任务中表现出了良好的性能,但仍不清楚它们是否可以建立连贯的空间理解,对其采取行动,并通过多轮反馈来完善其行动。为了研究这个问题,我们引入了 \textbf{SpatialAct},一个基于模拟器的基准,用于在 3D 场景中探测 \textit{动作条件空间推理}。从最具挑战性的设置“多轮交互式细化”开始,我们进一步设计了其分解的对应部分“单步错误检测和修复”,以及五个基本的空间能力任务来诊断模型失败的根本原因。实验揭示了明显的推理与行动差距:当前的 VLM 可以在孤立的空间推理任务上表现良好,但难以维持连贯的空间信念并在多轮反馈期间产生可靠的行动,远远落后于人类。这些结果表明,当前的 VLM 智能体在动作引起的环境变化下仍然缺乏鲁棒的空间状态跟踪,即使低级控制被抽象出来也是如此。