论文

CrossModalQA:多模态检索增强生成的跨模态和多跳基准

CrossModalQA: A Cross-modal and Multi-hop Benchmark for Multimodal Retrieval-augmented Generation

模型评测基准与评测资源

摘要

尽管多模态 大语言模型 (MLLM) 功能强大,但其参数知识仍然不完整且难以更新,从而激发了多模态检索增强生成 (RAG) 对外部文本和图像中的地面响应。然而,现有的基准面临两个主要限制:(i)它们通常强调对一小组提供的上下文进行单跳检索或推理,而不是开放域证据发现; (ii)它们提供了跨模式推理路径的碎片化覆盖,使得复杂的多跳和多图像推理未被充分探索。在本文中,我们介绍了 CrossModalQA,这是一个开放域基准,用于评估异构语料库的多模态检索和推理。 CrossModalQA 包含由 4,987 篇维基百科文章和 4,431 个维基共享资源图像构建的 1,863 个问答对。它涵盖了五个互补的推理路径:视觉到文本、文本到视觉、视觉到文本到视觉、多图像交叉和图像集推理。每个问题都需要检索和组合分布式文本和视觉证据,平均推理深度为 3.50 跳。我们通过多模态知识图引导的子图采样构建基准,并应用基于规则的一致性检查和LLM验证,以确保多模态依赖性和可追溯的证据。大量实验表明,现有的多模态 RAG 系统很难恢复完整的证据链,并且当不完整的检索引入分散注意力的上下文时,其性能可能会低于闭卷模型。进一步的分析表明,完整的跨模式检索比生成器缩放对答案准确性的贡献更大,而多图像检索和推理仍然是限制端到端性能的主要瓶颈。