论文

SalArt-VQA:诊断 VLM 是否理解生成图像中的显着伪像

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于检测人工智能生成的图像是否包含可见伪影,但人们对它们分析此类伪影的能力仍然知之甚少。正确的图像级决策仍然可以隐藏重要的失败:模型可能会在依赖错误的视觉提示、选择错误的区域或描述图像不支持的缺陷时正确标记伪影。为了直接评估这些行为,我们引入了 SalArt-VQA,这是一种诊断基准,用于对 AI 生成的图像进行细粒度的 SALient ARTifact 理解。 SalArt-VQA 包含 950 张图像和 3,681 个人工创作的多项选择题,涵盖伪影图像、匹配的真实参考图像和配对生成的参考图像。四种对齐的问题类型评估存在检测、语义定位、空间定位和基于证据的缺陷识别,而当注释的缺陷不存在时,参考将测试校准和弃权分开。在 20 个 VLM 中,SalArt-VQA 揭示了图像级检测精度隐藏的失败:最强的模型在伪影图像上达到 99.37% 的检测召回率,但仅在 53.26% 的图像上正确回答了所有四个伪影方面的问题。将伪影图像与无伪影参考进行比较揭示了灵敏度校准权衡:敏感模型经常做出不受支持的伪影声明,而保守模型主要通过丢失真实伪影来避免误报。这些结果表明,高伪影检测精度本身并不意味着有基础的伪影理解。 SalArt-VQA 公开了这些隐藏的故障模式,并提供了对 VLM 工件声明是否得到本地视觉证据支持的细粒度评估。