论文

LLM能从文本构建世界模型吗?空间推理的多语言诊断

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

模型评测基准与评测资源

摘要

大语言模型(LLM)能否从纯文本描述构建内部空间世界模型仍存争议,而此类能力能否跨语言迁移也尚未得到系统研究。我们提出MentalMap,一个多语言诊断基准,具有六级能力层级(L0-L5),覆盖从原子空间事实到生成式世界图构建,并配有四个诊断轴,分别探测参照系、阅读方向偏置、推理努力分配与幻觉。MentalMap基于100个ProcTHOR家庭场景构建,覆盖八种类型学上多样的语言外加一个结构化文本对照,包含39个任务族、共计1950个评测单元。通过评估13个跨规模、跨模型系列的LLM,我们识别出一个普遍存在的L3推理悬崖:一旦基线原子准确率超过40%,没有任何模型能在视点推理上保住其L0性能的一半。这一悬崖在语言、规模和提示策略之间持续存在,而结构化输出失败与推理模式则在各模型间差异显著。在完全相同的纯文本协议下开展的人类评估复现了同样的失败模式,表明瓶颈源于纯文本工作记忆的约束,而非当前LLM架构所特有。我们的发现将纯文本空间推理重新框定为一个多轴世界建模问题,并将多模态与草稿纸增强推理确立为未来方向。

LLM能从文本构建世界模型吗?空间推理的多语言诊断:论文配图
图 1:MentalMap 概述。 (A) 场景到文本的构建。 ProcTHOR 场景被分解为可追踪的世界状态工件(对象、容器、遏制、支持、空间关系),然后转换为单动作和多动作时间案例,使用规范的地面实况、输出格式、标准化器和评估器键来实例化基准项目。 (B) 六级能力阶梯(L0–L5),从表面(原子物体状态)到基底(聚焦图输出);每个级别都会列出其任务系列、示例项目、基本事实和评分规则。 (C) 结果处理。 JSON/图形/事件输出的结构标准化、任务级评分(方向匹配、事件正确性、图形指标、幻觉惩罚)以及沿模型、级别、语言、描述模式、提示机制和轴标签的聚合分析。 (D) 多语言提示和推理。统一的规范场景加上提示模板和空间词典词典可渲染八种语言(zh、en、ja、ko、es、ar、th、de);特定于语言的别名和规范术语支持多语言答案评估。