论文

M$^3$-VQA:多模式、多实体、多跳视觉问答的基准

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

模型评测基准与评测资源

摘要

我们提出了 M$^3$-VQA,一种新颖的基于知识的视觉问答(VQA)基准,以增强多模态 大语言模型(MLLM)在细粒度多模态实体理解和复杂多跳推理方面的评估。与现有的 VQA 数据集专注于粗粒度类别和对单个实体的简单推理不同,M$^3$-VQA 引入了多种多实体问题,涉及来自视觉和文本源的多个不同实体。它需要模型在多个文档中执行顺序和并行多跳推理,并由可追踪的详细证据和精心策划的多模态知识库支持。我们在三种环境下评估了 16 个领先的 MLLM:没有外部知识、有黄金证据以及有检索增强输入。糟糕的结果揭示了 MLLM 在知识获取和推理方面面临的重大挑战。在没有外部信息的情况下,模型表现不佳,但在提供精确证据时,模型会显着改善。此外,推理感知代理检索超越了启发式方法,凸显了结构化推理对于复杂多模态理解的重要性。 M$^3$-VQA 为提高 MLLM 的多模态推理能力提供了更具挑战性的评估。我们的代码和数据集可在 https://github.com/CASIA-IVA-Lab/M3VQA 获取。