论文
识别和解决基于知识的 VQA 基准的陷阱:审核、修复和增强
Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting
摘要
基于知识的视觉问答 (KB-VQA) 旨在评估视觉语言模型 (VLM) 是否可以对视觉证据之外的外部结构化知识进行检索、建立证据对应和推理。在实践中,答案准确性被广泛采用作为主要评估指标,隐含地将正确性视为基于知识的推理的代理。然而,对于现有的 KB-VQA 基准,此代理依赖于经常被忽视并因基准问题而变得不可靠的关键假设:带注释的答案必须可从相关知识库中导出,问题必须在足够的约束下正确提出,并且视觉设置必须有意义地需要视觉证据消歧。在这项工作中,我们证明了现有 KB-VQA 基准测试系统地违反了这些假设。我们的审计揭示了大量答案缺失或矛盾以及问题未明确说明的情况,导致准确性成为一种误导性指标。此外,我们发现现有数据集依赖于视觉上琐碎的单一实体场景,从而绕过了复杂的视觉到知识映射的需要。我们证明,即使采用受控架构,这些缺陷也会导致模型排名扭曲和推理能力高估。为了解决这个问题,我们引入了(1)一个有原则的审计和修复协议,它恢复了答案的可推导性和问题的清晰度,以及(2)一个受控的多实体增强协议,它引入了视觉模糊性来挑战初始检索和基础推理。在更正和增强的设置下重新评估会产生明显不同的性能趋势。我们的研究结果要求重新思考评估协议并设计更多交互感知的 KB-VQA 基准,优先考虑可验证的推理而不是简单的匹配。