论文
从人类认知到神经激活:探索 LLM 中空间推理的计算原语
From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs
摘要
随着空间智能成为基础模型越来越重要的功能,目前尚不清楚 大语言模型' (LLM) 在空间推理基准上的表现是否反映了结构化的内部空间表示或对语言启发法的依赖。我们通过研究空间信息的内部表示和使用方式,从机械的角度来解决这个问题。借鉴人类空间认知的计算理论,我们将空间推理分解为三个原语:关系组合、表征变换和状态空间更新,并为每个原语设计受控任务族。我们在单通道推理下评估英语、中文和阿拉伯语的多语言 LLM,并使用线性探测、基于稀疏自动编码器的特征分析和因果干预来分析内部表示。我们发现与任务相关的空间信息被编码在中间层中,并且可以因果影响行为,但这些表示是瞬态的,在任务族中分散,并且弱集成到最终预测中。跨语言分析进一步揭示了机械简并性,即相似的行为表现源于不同的内部途径。总体而言,我们的结果表明,当前的 LLM 表现出有限且依赖于上下文的空间表示,而不是稳健的通用空间推理,这凸显了对超越基准精度的机械评估的需求。