论文
使用 OCR 头来表达图像语义
Using OCR Heads to Verbalize Image Semantics
摘要
VLM 如何从像素映射到语义?为了理解这个一般性问题,我们关注一个狭义的问题:研究 VLM 如何执行光学字符识别 (OCR)。在四个模型中,我们识别了 OCR 因果所需的注意力头,并发现这些实际上是通用头,可以在所有图像标记中输出可解释的语义特征。例如,将这些头部指向包含单词“bike”的图像标记会导致 Qwen3-VL-8B 输出“bike”,但将它们指向鸟翼会导致模型输出标记“feathers”。我们将这些头的注意力权重分解为单个语言化镜头转换,该转换揭示了所有层的隐藏状态中可解释的语义特征。当与词汇空间的投影相结合时,我们可以获得从第 0 层开始的可解释标签,这表明图像表示实际上与早期层中的语言保持一致。我们发现我们还可以使用这种变换的逆过程来编辑非单词概念,例如,在自然图像中用左轮手枪替换拖拉机,提供因果证据表明该子空间不仅仅适用于 OCR。我们的结果是对特定机制的研究如何揭示更广泛的可解释性问题的一个例子。