论文
LLM能从文本构建世界模型吗?空间推理的多语言诊断
Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning
摘要
大语言模型(LLM)能否从纯文本描述构建内部空间世界模型仍存争议,而此类能力能否跨语言迁移也尚未得到系统研究。我们提出MentalMap,一个多语言诊断基准,具有六级能力层级(L0-L5),覆盖从原子空间事实到生成式世界图构建,并配有四个诊断轴,分别探测参照系、阅读方向偏置、推理努力分配与幻觉。MentalMap基于100个ProcTHOR家庭场景构建,覆盖八种类型学上多样的语言外加一个结构化文本对照,包含39个任务族、共计1950个评测单元。通过评估13个跨规模、跨模型系列的LLM,我们识别出一个普遍存在的L3推理悬崖:一旦基线原子准确率超过40%,没有任何模型能在视点推理上保住其L0性能的一半。这一悬崖在语言、规模和提示策略之间持续存在,而结构化输出失败与推理模式则在各模型间差异显著。在完全相同的纯文本协议下开展的人类评估复现了同样的失败模式,表明瓶颈源于纯文本工作记忆的约束,而非当前LLM架构所特有。我们的发现将纯文本空间推理重新框定为一个多轴世界建模问题,并将多模态与草稿纸增强推理确立为未来方向。
