论文
前沿 LLM 模型中空间意象推理的局限性
Limits of Spatial Imagery Reasoning in Frontier LLM Models
摘要
大语言模型 (LLM) 表现出了令人印象深刻的推理能力,但他们在需要心理模拟的空间任务(例如心理旋转)方面遇到了困难。本文研究了为 LLM 配备外部“图像模块”(一种能够渲染和旋转 3D 模型的工具)是否可以弥补这一差距,充当“认知假体”。我们使用双模块架构进行了实验,其中推理模块(MLLM)与图像模块在 3D 模型旋转任务上进行交互。性能低于预期,准确率最多达到62.5%。进一步的调查表明,即使维护和操作整体 3D 状态的负担被外包,系统仍然会失败。这表明当前的前沿模型缺乏与图像交互所需的基础视觉空间基元。具体来说,它们缺乏:(1)提取空间信号的低灵敏度,例如(a)深度、(b)运动和(c)短视界动态预测; (2) 对图像进行沉思推理、动态转移视觉焦点以及平衡图像与符号和关联信息的能力。