论文
看看实际情况:用于 VLM 中代理视觉证据反事实评估的 PriVE-Bench 和 PriVE-Tools
Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs
摘要
视觉语言模型(VLM)通常使用学习的语言和类别先验来回答视觉问题,而不是根据图像本身进行预测。反事实图像为这种故障模式提供了自然的诊断设置:当可见证据与通常的真实情况相矛盾时,基于视觉证据的模型应该从像素中回答,而先验跟随模型将产生规范但视觉上不正确的响应。然而,现有的反事实基准主要询问这种先验跟随行为是否存在。在本文中,我们提出了一个由工具增强和代理视觉系统的兴起引发的进一步问题:额外的视觉证据视图能否帮助 VLM 对其先验进行推理?我们引入了 PriVE-Bench,这是一种先验与视觉证据基准,它使用配对的原始图像和反事实图像来区分基于视觉的答案和先验一致的错误。我们进一步介绍了 PriVE-Tools,这是一个受控的代理视觉启发的扩展,它评估工具衍生的视觉证据(包括边界框、裁剪、缩放面板和轮廓)是否可以改善相同反事实冲突下的基础。在开源和闭源 VLM 中,我们使用准确性、先验跟随错误率和其他响应率来比较原始、配对图像和工具条件输入。我们的结果表明,视觉证据工具在某些情况下可以提供帮助,特别是当模型可以有效地使用本地化证据时,但它们并不是通用的补救措施:即使明确提供了相关的视觉证据,一些模型仍继续遵循语言和类别先验。