论文

VISTAQA:联合视觉问答和像素级证据的基准测试

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

模型评测基准与评测资源

摘要

在模型预测和支持它们的视觉证据之间建立清晰的联系对于多模态推理的透明度和可靠性至关重要,但当前的多模态 大语言模型 (MLLM) 评估并没有明确强制这种一致性。现有的基准测试单独评估文本答案的正确性或像素级定位,从而使推理和基础的耦合成为一个开放的挑战。我们介绍 VISTAQA,这是一个综合基准,用于联合评估视觉问答中自由形式答案正确性和像素级证据基础。 VISTAQA 包含 1,157 个专家策划的样本,涵盖六种任务类型和六个视觉领域,范围从直接感知到组合和关系推理。 VISTAQA 要求模型不仅要正确回答,还要提供支持其答案的精确分割掩码。它还包括不存在有效视觉证据的幻觉感知示例。为了支持这种增强的评估,我们引入了 GROVE,这是一种统一的评估指标,通过每个样本的几何平均值将文本准确性和基础质量结合起来,以确保两个维度都无法弥补另一个维度的缺陷,从而增强联合正确性。对视觉证据定位感知模型和具有通用 MLLM 的混合管道进行的综合实验表明,即使是最强大的系统在 GROVE 下也能实现有限的性能,这突显了答案准确性和视觉证据对齐之间的巨大差距。