论文

看不见还是不知道?视觉语言模型中的错误归因

Failing to See or Failing to Know? Attributing Errors in Vision-Language Models

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)可以识别清晰图像中的实体,但在回答需要超出直接观察范围的事实知识的问题时仍然会失败。之前的工作要么孤立地检查各个故障模式,要么将错误的答案视为整体、二元故障。我们提出了一个树形结构框架,将知识密集型视觉问答中的失败组织成特定于模型的操作结果。在两个数据集和四个 VLM 中,我们观察到操作结果的一致分布:一些故障发生在实体识别之前,而其他故障则在相关实体被识别之后仍然存在。视觉标记表示对于识别相关决策来说信息最丰富。尽管事实访问归因仍然很困难并且仅表现出微弱的信号,但提示隐藏状态可以更有效地预测答案的成功。这些预生成信号支持归因引导路由到有针对性的干预措施,包括图像修复、实体支持、问题重写和事实证据。