论文

自回归马赛克:探测纯文本语言模型的二维空间推理

Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models

模型评测基准与评测资源

摘要

仅在文本和代码上训练的大语言模型 (LLM) 有时可以生成绘制可识别图像的程序。然而,尚不清楚这是否反映了二维空间布局的内部表示,或者仅仅是将空间描述转换为代码的能力。我们引入了自回归马赛克(AM-Bench),这是一个区分这些因素的基准:首先,翻译任务为模型提供完全指定的图片几何图形作为提示,并要求生成它的代码。其次,布局任务要求模型根据未指定的提示组成图像。在八个开放式纯文本和代码模型中,所有模型都可靠地将指定的几何图形转换为代码,但它们的开放式布局性能差异很大,这表明这些差异不能仅用代码生成能力来解释。输出媒介消融进一步表明模型使用的界面或表达媒介很重要:用原始 SVG 替换程序代码可以提高所有模型的布局分数。最后,探测模型激活显示在生成之前存在粗略布局计划,但仅反映提示所暗示的布局。在生成过程中,模型跟踪不断变化的几何状态,而不是执行最初固定的计划。总的来说,这些结果表明纯文本LLM的 2D 空间性能取决于模型和输出介质,并且不能仅用代码生成能力来解释。

自回归马赛克:探测纯文本语言模型的二维空间推理:论文配图
图1:AM-Bench区概况。基准包括一个四阶段管道(即时、内部计划、程序代码、光学几何)。翻译任务以提示方式充分说明布局;在布局任务中,布局没有详细说明,需要由模型决定。三次实验试验表达式(Exp. 1),输出介质的影响(Exp. 2),以及一项计划是否在生成前是可以降解的(Exp. 3)。