论文
视觉不敏感差距:当视觉语言模型无法使用视觉证据时进行诊断
The Visual Insensitivity Gap: Diagnosing When Vision-Language Models Fail to Use Visual Evidence
摘要
视觉语言模型通过多模态基准的总体准确性进行评估,这种做法隐含地假设模型使用其视觉输入。我们表明,这种假设在 6 个 VLM 和 3 个感知基准中 40%--97% 的样本上失败了:模糊与问题相关的视觉区域使下一个标记分布几乎不变。我们将这种现象命名为“视觉不敏感差距”,并用每个样本的视觉敏感度指数(VSI)对其进行量化。差距是样本的属性,而不是模型的属性:VSI 排名在模型之间相关(总均值 Spearman rho=+0.40,排列 p<10^-3),因此相同的样本被 VLM 标记为不敏感,除了对比预训练的视觉塔之外,不共享任何架构细节。该机制是具体的:在不敏感的样本上,每个模型自己的视觉塔上的线性探针以 0.72--0.79 的精度区分受干扰的图像和干净的图像,但模型的 argmax 标记仅在 2%--11% 的相同样本上发生变化,编码器 - LLM 在每个模型上的差距都高于 0.65。逐个单元地映射 VSI 的诊断实用程序,可以看到强机制(在有能力的 VLM 上进行多项选择推理:AUROC=0.85--0.87)和弱机制(经过良好校准的事实性,其中 softmax 置信度已经领先)。 VSI 并不是通用的最佳弃权信号;它是视觉忽略失败的样本内在指标,最好用作条件集成组件。