论文

LLM与VLM如何在无视觉条件下理解视角旋转?一项可解释性研究

How Do LLMs and VLMs Understand Viewpoint Rotation Without Vision? An Interpretability Study

模型评测模型行为与机制分析

摘要

过去一年,空间智能受到越来越多的关注。许多已有工作从视觉-空间智能的视角研究它,其中模型可以从视觉输入获得视空间信息。然而,在缺乏视觉信息的情况下,仅凭语言智能是否足以赋予模型空间智能,以及模型在纯文本输入下如何完成相关任务,仍属未探索的问题。因此,本文从语言视角聚焦空间智能中一项基础而关键的能力:视角旋转理解(VRU)。具体而言,给定多步视角旋转与观察的文本描述,要求 LLM 与 VLM 推断其最终视角并预测环境中的相应观察。我们发现 LLM 与 VLM 在我们提出的数据集上表现都很差,而人类可以轻松达到 100% 准确率,这表明当前模型能力与空间智能的要求之间存在巨大差距。为揭示底层机制,我们进行了逐层探测分析与注意力头层面的因果干预。我们的发现表明,尽管模型在隐藏状态中编码了视角信息,但它们似乎难以将视角位置与相应观察绑定,导致在最后几层中出现幻觉。最后,我们选择性地微调由因果干预识别出的关键注意力头,以提升 VRU 性能。实验结果表明,这种选择性微调在提升 VRU 性能的同时,避免了通用能力的灾难性遗忘。我们的数据集与代码将发布于 https://github.com/Young-Zhen/VRU_Interpret。

LLM与VLM如何在无视觉条件下理解视角旋转?一项可解释性研究:论文配图
图1:文本视角旋转理解任务示例:人类可凭想象轻松答对,而LLM与VLM难以给出正确答案,凸显模型空间推理短板。