论文

不仅仅是表面上看:通过语义锚定测量视觉语言模型中的符号差距

More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 擅长生成逼真的图像,但通常难以表示抽象含义,例如名词复合词的惯用解释。为了研究高视觉保真度是否会干扰视觉抽象下的惯用构图,我们引入了 DIVA,这是一种受控基准,通过为字面和惯用阅读生成配对的、以感觉为基础的可视化,用图式象似性取代高保真视觉细节。我们进一步提出语义对齐差距($Δ$),这是一种与架构无关的指标,用于量化字面和惯用视觉基础之间的差异。我们还引入了方向符号偏差 $b(t)$ 来单独测量文字偏好的方向和强度。通过评估最近的 8 个 VLM,我们揭示了一致的文字优越性偏差:模型规模本身并不能解决文字偏好,并且视觉保真度的增加与符号对齐较弱相关,这表明超现实图像的认知干扰。我们的研究结果表明,提高构图理解需要对视觉输入进行图像抽象,并将解释和生成锚定在预期含义中。