论文
SpatialWorld:真实世界任务中多模态智能体交互空间推理基准
SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks
摘要
空间推理是多模态大语言模型 (MLLM) 在物理世界中感知和操作的基本能力。然而,现有的基准主要依赖于被动评估(例如静态 VQA)或模拟器特定的管道,无法评估一般的交互式空间理解。我们引入了 SpatialWorld,这是一个专门为评估复杂现实任务中多模态代理的交互式空间理解而设计的统一基准。 SpatialWorld 在一个共享的、与模拟器无关的协议下集成了 8 个异构模拟后端,具有跨不同领域(例如家庭日常事务、旅行、社交协作)的 760 个人工注释任务。代理必须在仅视觉部分可观察性下解决任务,积极收集以自我为中心的视觉证据,并通过 MLLM 原生的统一的、基于文本的操作界面表达决策。为了进行可靠的评估,每个任务都包括人工验证的初始状态、参考轨迹和最终状态验证器。对 15 个高级智能体的评估表明,稳健的空间任务解决仍然具有挑战性:最强的模型 GPT-5 的平均任务成功率 (TSR) 仅 17.4%,而领先的开源模型 Qwen-3.5 达到 14.1%。进一步的分析揭示了任务成功与执行效率之间明显的不匹配,以及大量特定领域的性能变化。主动探索和长期规划中的这些瓶颈使 SpatialWorld 成为未来空间智能体的严格测试平台。
