论文
ChartArena:跨语言、场景和格式的图表解析基准测试
ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats
摘要
图表是传达定量和关系信息的主要媒介,但系统地评估图表解析模型仍然很困难。现有的基准侧重于狭窄的图表类型,而流程图和思维导图等图表结构基本上没有得到解决,而模型以不兼容的格式生成输出,并且数据集很少包括实践中遇到的打印或手绘图像。为了解决这些问题,我们推出了 ChartArena,这是一个全面的双语基准测试,涵盖涵盖数字图表和图表结构的八个图表系列,每个图表系列都在三种视觉场景中进行评估:数字渲染、打印照片和手绘照片。该数据集是通过人工代理协作注释管道构建的,具有多阶段人工验证,以确保注释的可靠性。为了实现公平的跨模型比较,我们进一步设计了一种与格式无关的评估协议,将异构输出映射到两个规范语义空间、标准化三重视图和有向图视图,并使用结构感知指标对它们进行评分。通过对 26 个领先 MLLM 的广泛评估,我们观察到三个一致的发现:(i)Gemini 3.1 Pro 等前沿专有模型总体领先,但最强大的开源系统正在迅速缩小差距; (ii) 文档解析模型可以合理地处理数字图表,但在图表结构方面却严重落后; (iii) 专家图表解析器仍然仅限于狭窄的图表系列。在所有模型中,雷达图和手绘场景仍然特别具有挑战性。这些发现表明,ChartArena 暴露了明显的能力差距,并为未来的进步提供了统一的基础。 ChartArena 可在 https://github.com/pspdada/ChartArena 上公开获取。