论文
视觉语义熵:视觉语言模型能否识别视觉歧义?
Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
摘要
视觉语言模型可以对视觉上模糊的输入产生可信的答案,从而导致有偏差的预测。常见的基于熵的方法,例如语义熵 (SE),依赖于输出多样性。然而我们的分析表明,过度自信的视觉嵌入会抑制随机解码下的输出多样性,导致 SE 在这种情况下低估不确定性。最近的方法通过输入扰动(包括文本释义或联合文本图像扰动)来探测输出多样性,并显示出改进的性能。我们研究这些方法并揭示,由此产生的变异性通常由文本变化而不是视觉证据主导,导致不确定性估计反映即时敏感性而不是视觉模糊性。因此,我们提出视觉语义熵(VSE),它仅扰乱图像以探测附近的视觉变化,同时保持文本查询固定。 VSE 通过将生成的答案聚类为语义原型并计算它们之间的质量加权离散度来测量不确定性。对五种现代视觉语言模型和五种不同的 VQA 基准的广泛评估表明,VSE 有效地捕获了视觉模糊性,为 VLM 不确定性估计建立了新的最先进技术。