论文
LLM会构建空间世界模型吗?来自网格世界迷宫任务的证据
Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks
摘要
基础模型在多样任务上表现出色,但其构建用于推理与规划的内部空间世界模型的能力仍不明确。我们通过迷宫任务系统评估大语言模型的空间理解能力,迷宫任务是一个需要多步规划与空间抽象的受控测试情境。在针对Gemini-2.5-Flash、GPT-5-mini、Claude-Haiku-4.5和DeepSeek-Chat的全面实验中,我们发现空间推理存在显著差异,这挑战了关于LLM规划能力的假设。使用思维链提示时,Gemini在采用词元化邻接表示的较小迷宫(5x5到7x7网格)上达到80-86%的准确率,但在视觉网格格式下性能骤降至16-34%,这相差2-5倍,表明其空间推理依赖于表示形式而非格式不变。我们进一步通过序列邻近性问题和组合性距离比较来探究空间理解。尽管推理轨迹中的语义覆盖率达到96-99%,模型却未能将这种理解用于一致的空间计算,表明它们将每个问题独立处理,而非积累式地构建空间知识。基于迷宫求解任务的发现表明,LLM并未发展出稳健的空间世界模型,而是表现出特定于表示、依赖提示的推理,仅在狭窄条件下成立。这些结果对在需要空间抽象的应用中部署基础模型具有重要启示。
