论文
眼见为实:揭示评估者视觉语言模型中的盲点
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
摘要
大型视觉语言模型 (VLM) 越来越多地用于评估其他模型的输出,用于图像到文本 (I2T) 任务,例如视觉问答和文本到图像 (T2I) 生成任务。尽管依赖性日益增强,但这些 Evaluator VLM 的可靠性仍有待探索。在这项工作中,我们系统地评估了 Evaluator VLM 在 I2T 和 T2I 任务中的可靠性。我们引入了有针对性的扰动,这些扰动会沿着关键误差维度降低输出质量,包括物体幻觉、空间推理、事实基础和视觉保真度。这些扰动测试评估器 VLM 是否能够可靠地解释其评估中的这些质量下降错误。使用涵盖 40 个扰动维度的 4000 多个扰动实例的综合基准,我们使用单一答案评分、成对比较和参考引导范例来评估 4 个著名的 VLM。我们的研究结果表明,当前的 VLM 评估器表现出很大的盲点:它们经常无法检测到扰动的输出 - 在某些情况下超过 50%,特别是在处理细粒度的构图和空间错误时,并且通常对与输入图像相矛盾的幻觉内容不敏感。尽管失败率仍然存在,但成对比较被证明更可靠。这些结果凸显了当前 Evaluator VLM 的不可靠性,并敦促在部署基准测试和开发决策时务必谨慎。代码和数据已公开。