论文

Theory of Space:基础模型能否通过主动探索构建空间信念?

Theory of Space: Can Foundation Models Construct Spatial Beliefs through Active Exploration?

智能体系统Agent任务评测

摘要

空间具身智能要求智能体在部分可观测条件下通过行动获取信息。尽管多模态基础模型擅长被动感知,其主动的、自主导向的探索能力仍缺乏研究。我们提出空间理论(Theory of Space),定义为智能体通过自主的主动探索获取信息,并从序贯的、部分的观测中构建、修订与利用空间信念的能力。我们通过一个基准来评估这一能力,其目标是进行好奇心驱动的探索以构建准确的认知地图。一个关键创新是空间信念探测(spatial belief probing),它提示模型在每一步揭示其内部空间表征。我们对最先进模型的评估揭示了若干关键瓶颈。首先,我们识别出主动-被动差距(Active-Passive Gap),即当智能体必须自主收集信息时性能显著下降。其次,我们发现效率低下:与基于程序的代理相比,模型的探索缺乏系统性。通过信念探测,我们诊断出:尽管感知是初始瓶颈,但全局信念存在不稳定性,导致空间知识随时间退化。最后,利用错误信念范式,我们揭示了信念惰性(Belief Inertia),即智能体未能用新证据更新过时的先验。这一问题存在于基于文本的智能体中,但在基于视觉的模型中尤为严重。我们的发现表明,当前基础模型难以在主动探索过程中维持连贯、可修订的空间信念。

Theory of Space:基础模型能否通过主动探索构建空间信念?
图19:示例轨迹,展示了 GEMINI-3 Pro 在视觉世界中的找门策略与系统性扫视模式:一旦检测到门,智能体便朝其导航,并执行一次策略性旋转以最大化环境覆盖。当所有目标对象都被成功识别后,该过程即终止。