论文
不看而见:视觉语言基准真的能测试视觉吗?
Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
摘要
基准准确性通常被隐含地假设为反映视觉语言模型(VLM)中基于视觉的理解,但目前尚不清楚这些分数在多大程度上真正反映了对视觉证据的依赖。出于一个令人惊讶的观察结果,即在广泛使用的幻觉基准上,删除大部分图像标记只会略微降低模型性能,因此我们系统地研究了一组开源 VLM 中的这种不匹配情况。我们的分析涵盖多个粒度级别,涵盖全局视觉退化、局部遮挡、问题重新表述、答案空间扩展以及超出标准精度的决策级分析。我们通过视觉词元几何的分层分析进一步补充这些行为结果。在整个实验中,我们发现虽然 VLM 确实包含了视觉输入,但它们的预测对于标准准确度应该暗示的细粒度视觉证据的丢失不太敏感。即使最终预测保持不变,模型对正确答案的内部支持可能已经被削弱。我们进一步补充了表示级分析,该分析显示了更深层次的视觉标记之间的相似性不断增加,为我们的发现提供了可能的解释。总之,这些结果表明当前的基准不足以可靠地评估 VLM 中的细粒度视觉基础。