论文

CounterCount:用于计算视觉语言模型中偏差的诊断框架

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

模型评测基准与评测资源

摘要

视觉语言模型(VLM)擅长多模态推理,但仍不清楚它们的答案是基于视觉证据还是由学习的语言和世界先验驱动。计数提供了一个精确的测试平台:当视觉证据与规范对象知识发生冲突时,模型必须依赖于图像而不是原型计数。我们介绍了 CounterCount,这是一种用于 VLM 中反事实计数的诊断框架,由配对的事实图像和反事实图像以及经过编辑的计数相关属性、经过验证的答案和本地化证据注释组成。通过评估最近的 VLM,我们发现在事实图像上表现强劲,但在反事实属性变化下持续退化,这表明即使存在矛盾的视觉证据,也依赖于对象级先验。使用本地化注释,我们表明这些失败不仅仅是由于缺失或模糊的视觉证据,而是由于模型低估了对计数相关视觉标记的关注。我们引入了一种统一的推理时间注意力调制策略,该策略可以重新加权选定的视觉标记,从而将多个 VLM 的反事实计数准确性提高高达 8%。总体而言,CounterCount 揭示了先前驱动的计数故障,并为设计未来的 VLM 提供了诊断见解。