论文
自回归马赛克:探测纯文本语言模型的二维空间推理
Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models
摘要
仅在文本和代码上训练的大语言模型 (LLM) 有时可以生成绘制可识别图像的程序。然而,尚不清楚这是否反映了二维空间布局的内部表示,或者仅仅是将空间描述转换为代码的能力。我们引入了自回归马赛克(AM-Bench),这是一个区分这些因素的基准:首先,翻译任务为模型提供完全指定的图片几何图形作为提示,并要求生成它的代码。其次,布局任务要求模型根据未指定的提示组成图像。在八个开放式纯文本和代码模型中,所有模型都可靠地将指定的几何图形转换为代码,但它们的开放式布局性能差异很大,这表明这些差异不能仅用代码生成能力来解释。输出媒介消融进一步表明模型使用的界面或表达媒介很重要:用原始 SVG 替换程序代码可以提高所有模型的布局分数。最后,探测模型激活显示在生成之前存在粗略布局计划,但仅反映提示所暗示的布局。在生成过程中,模型跟踪不断变化的几何状态,而不是执行最初固定的计划。总的来说,这些结果表明纯文本LLM的 2D 空间性能取决于模型和输出介质,并且不能仅用代码生成能力来解释。
