论文
TestHallVQA:在科学考试的冗余上下文下探索 LVLM 的文档级推理
TestHallVQA: Exploring LVLMs' Document-Level Reasoning under Redundant Contexts from Scientific Exams
摘要
人们越来越期望大视觉语言模型 (LVLM) 在平面媒体上执行视觉问答 (VQA)。然而,现有的平面 VQA 基准通常强调孤立的挑战:有些强调推理深度有限的长文档理解,而另一些则需要复杂的视觉推理,但仍仅限于单页、无噪声设置。此外,通过理论分析,我们确定了不相关视觉标记的影响,这会导致可测量的性能下降,但在系统量化方面却很少受到关注。为了解决这些限制,我们引入了 TestHallVQA,这是一种多图像 VQA 基准,它同时体现了文档级规模和人工检查的难度,同时提供全面的任务覆盖范围。利用 TestHallVQA 可控注入多级上下文冗余的能力,我们进一步提出了一种新的度量 F1-R\textsuperscript{2},它联合量化了 LVLM 的计算推理能力及其针对文档级冗余的证据检索鲁棒性。对主流 LVLM 的大量实验和分析揭示了它们在多个维度上的潜在缺陷,为未来的研究提供了具体的见解和方向。相关数据集、代码和完整的理论推导可在 https://github.com/yqyu2317/TestHallVQA-benchmark 上获取。