论文
VLM 需要文字:视觉语言模型忽略视觉细节而偏向语义锚
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
摘要
视觉语言模型 (VLM) 在各种多模式任务中取得了令人印象深刻的性能。然而,即使所需的信息仍然存在于其内部表征中,它们也常常无法完成需要细粒度视觉感知的任务。先前的工作将这种“隐藏在视线中”的差距归因于语言模型,但原因仍然无法解释。在这项工作中,我们证明了这种差距是由于语言模型缺乏细粒度视觉细节的语义标签而产生的:当视觉实体可以映射到已知概念时,VLM 就绕过了通过语言进行的视觉比较和推理;当他们做不到的时候,VLM 就会求助于脆弱的、幻觉的描述。我们通过语义对应、合成形状匹配和面部匹配来验证这一点,并发现当相关实体可命名时,VLM 的性能比它们不可命名时要好得多。从机制上讲,logits Lens 分析证实,与不可命名实体相比,VLM 显式恢复可命名实体的语义标签,并显示更多独特的标记。此外,我们表明这个限制是可以解决的:为未知实体教授完全任意的名称可以提高性能。更重要的是,特定于任务的微调可以产生更强的泛化能力,而不依赖于语言先验,即通过真实的视觉感知。我们的研究结果表明,当前 VLM 在视觉任务上的失败反映了一种习得的捷径,而不是多模态推理的根本限制。代码和数据集可在 https://github.com/Patchwork53/VLMs-Need-Words-COLM2026 获取。