论文

学习绘制ASCII提升语言模型的空间推理能力

Learning to Draw ASCII Improves Spatial Reasoning in Language Models

模型训练监督微调与指令调优

摘要

面对复杂空间问题时,人类会自然地勾画布局来组织思路,而绘制这一行为本身也进一步深化了他们的理解。在这项工作中,我们追问类似的原则是否也适用于大语言模型(LLM):学习从空间描述中构建显式视觉布局,能否灌输真正的空间理解?我们提出Text2Space数据集,它将自然语言描述与真值ASCII网格布局及空间问答对配对,使我们能够把构建空间表征的失败与在空间表征上推理的失败区分开来。我们采用ASCII,因为它人类可读、完全在语言模型的词元空间内运作,并以结构上可验证的形式编码空间关系。我们的评估揭示了一种显著的“读-写不对称性”(Read-Write Asymmetry):LLM能够有效解读ASCII表征,却难以从文本生成它们,而且这些构建错误会向下游传播并导致错误答案。为解决这一局限,我们在布局构建(Text$\rightarrow$ASCII)上训练模型,发现这能显著提升仅凭文本进行的空间推理,即使在推理时不生成任何ASCII也是如此。将构建训练与理解训练相结合可进一步放大这些收益。关键的是,这些提升可迁移到三个外部空间推理基准上,这表明正如勾画能磨砺人类的空间思维,学习构建显式布局能够灌输可泛化到训练格式之外的空间理解。

学习绘制ASCII提升语言模型的空间推理能力:论文配图
图 1:研究设计概述。受人类经验认知策略的启发,我们利用自然语言 (NL) 和 ASCII 表示作为独立的推理源。这个双向循环通过解析、绘图、解释和描述步骤将两种模式连接起来。我们发现,训练LLM来模仿这种类人的、基于草图的推理过程可以显着提高复杂空间推理任务的准确性。