论文

SpatialText:一个面向大语言模型空间理解的纯文本认知基准

SpatialText: A Pure-Text Cognitive Benchmark for Spatial Understanding in Large Language Models

模型评测基准与评测资源

摘要

真正的空间推理依赖构建并操纵连贯内部空间表示(常被概念化为心理模型)的能力,而非仅处理表层语言关联。虽然大语言模型在多领域展现先进能力,现有基准未能把这种内在空间认知与统计语言启发式区分开。此外,多模态评估常把真正的空间推理与视觉感知混为一谈。为系统考察模型是否构建灵活的空间心理模型,我们提出 SpatialText,一个理论驱动的诊断框架。SpatialText 不只是一个数据集,而是通过双源方法隔离基于文本的空间推理。它把人工标注的真实 3D 室内环境描述(捕捉自然歧义、视角转换与功能关系)与代码生成的逻辑精确场景(用于探查形式空间演绎与认知边界)相结合。跨最先进模型的系统评估揭示了根本性的表示局限。虽然模型擅长检索显式空间事实并在全局非自我中心坐标系内运作,但在自我中心视角转换和局部参考系推理上存在关键失败。这些系统性错误有力证明当前模型严重依赖语言共现启发式,而非构建连贯、可验证的内部空间表示。因此 SpatialText 可作为诊断人工空间智能认知边界的严谨工具。

SpatialText:一个面向大语言模型空间理解的纯文本认知基准
图1:SpatialText框架概览:一个用于评估大语言模型(LLM)基于文本的空间认知的双源诊断基准。该框架通过双源方法(人工标注的真实场景与代码生成的逻辑场景)构建数据集,涵盖从定位到心理旋转的五项核心空间任务,旨在通过多维评估揭示模型构建心理模型的能力。