论文
CRAG-MM-Diagnostics:实现知识密集型 VQA 的阶段分析
CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA
摘要
知识密集型视觉问答 (KI-VQA) 基准通过要求提供的图像之外的外部信息来回答问题,从而将视觉语言模型 (VLM) 评估为多模式知识助手。 KI-VQA 涉及多个子问题——涉及表达理解、视觉基础、对象识别、知识检索和推理——但现有的基准通常仅报告最终任务的准确性,掩盖了失败发生的地方。为了分析完整的 KI-VQA 流程,我们引入了 CRAG-MM-Diagnostics,这是一种具有分阶段数据注释的诊断基准,可隔离 1) 基于语言的视觉基础、2) 对象识别和 3) 知识检索和推理。我们评估完全参数化和检索增强的 VLM,使用新收集的元数据(例如目标 ROI、实体名称和视觉复杂性分数)提供细粒度分析。我们的结果指出知识检索和推理是主要瓶颈,但也强调了 KI-VQA 管道其他部分的问题,例如 VLM 难以识别目标对象,或者图像 检索器 难以整合文本线索。这些发现揭示了当前 KI-VQA 系统的基本局限性,并激发了阶段感知评估。最后,我们利用这些发现提出了一种基于视觉证据的双模态 RAG 管道,该管道集成了视觉定位模块以在图像检索之前裁剪目标,从而将 GPT-5 和 Qwen 的准确度分别提高了 13.3 个和 8.5 个百分点。