论文

LongChart VQA:具有复杂多图表推理的 MLLM 的综合基准

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 正在快速发展,具有扩展的上下文窗口和更强的推理能力,可实现多图表理解和多步骤推理。随着 MLLM 在复杂的代理任务中的应用,这些能力变得越来越重要。然而,现有的基准主要强调单图表感知,而简单的图表到图表的连接不足以评估这些能力。为了捕获多图的复杂性,同时确保一致性和有效性,我们设计了一个由潜在图支持的综合管道。在此管道的基础上,我们引入了 LongChart,这是一个基准测试,其 VQA 集平均包含 6.5 张图像和 31.2 个问题。我们评估了 10 个最先进的 MLLM,并检查了影响性能的三个因素:推理模式、辅助工具和对图像扰动的鲁棒性。我们的结果表明,随着计算复杂性的增加,MLLM 的准确性会下降并且变化很大,这突出了多图推理的未来研究方向。