论文
视觉语言模型是看到还是猜测?使用短语控制的基准来测量和减少文本优先的依赖
Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark
摘要
视觉语言模型(VLM)越来越多地被部署,其中答案必须来自图像中的内容,但它们通常根据文本先验、问题的措辞以及记忆的世界知识来回答,而不是根据图像本身来回答,这会夸大基准分数并产生自信但毫无根据的答案。现有的基准测试很少隔离这种行为,因为每个图像通常与一个固定问题配对。为了衡量可靠性,我们构建了一个跨六个推理类别的 540 张图像基准,并针对相同图像生成了四个问题变体,因此措辞而不是图像内容是受控变量。最难的变体是直接从图像写入,以最大限度地减少文本泄漏。我们对 11 个 VLM 进行了基准测试,涵盖小型开放权重模型到大型闭源系统:每个模型都会在最困难的变体上降级,而开放模型下降最远。我们的核心诊断是无图像消融,它将开放权重模型折叠到纯文本底部(1% 到 9%)。三项进一步的分析,LLM 级难度、低的基础到最终文本相似性以及人工重新注释,证实了真正的图像依赖性。与变体构建方式相匹配的上下文样本可以恢复最大的准确性,并且小型 VLM 的 GRPO 后训练 在转移到保留的分布外集的所有四个变体中产生一致的增益。文本先验的依赖是可以测量的并且部分是可以训练的。