论文

LLM会构建空间世界模型吗?来自网格世界迷宫任务的证据

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

模型评测模型能力评测

摘要

基础模型在多样任务上表现出色,但其构建用于推理与规划的内部空间世界模型的能力仍不明确。我们通过迷宫任务系统评估大语言模型的空间理解能力,迷宫任务是一个需要多步规划与空间抽象的受控测试情境。在针对Gemini-2.5-Flash、GPT-5-mini、Claude-Haiku-4.5和DeepSeek-Chat的全面实验中,我们发现空间推理存在显著差异,这挑战了关于LLM规划能力的假设。使用思维链提示时,Gemini在采用词元化邻接表示的较小迷宫(5x5到7x7网格)上达到80-86%的准确率,但在视觉网格格式下性能骤降至16-34%,这相差2-5倍,表明其空间推理依赖于表示形式而非格式不变。我们进一步通过序列邻近性问题和组合性距离比较来探究空间理解。尽管推理轨迹中的语义覆盖率达到96-99%,模型却未能将这种理解用于一致的空间计算,表明它们将每个问题独立处理,而非积累式地构建空间知识。基于迷宫求解任务的发现表明,LLM并未发展出稳健的空间世界模型,而是表现出特定于表示、依赖提示的推理,仅在狭窄条件下成立。这些结果对在需要空间抽象的应用中部署基础模型具有重要启示。

LLM会构建空间世界模型吗?来自网格世界迷宫任务的证据:论文配图
图 1:主要迷宫导航任务概述。这说明了我们评估LLM是否构建空间抽象或依赖于表面水平模式匹配的系统框架。模型被要求导航以两种不同格式呈现的迷宫:邻接列表和视觉字符网格。在这里,我们对直接查询LLM进行了比较,其中模型往往会因为迷失在迷宫中而失败任务,而通过基于推理的提示成功解决任务。后者可以引出更加结构化和有效的导航路径。