论文

ChartDiff:面向图表对理解的大规模基准

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

模型评测基准与评测资源

摘要

图表是分析推理的核心,但现有图表理解基准几乎只关注单图解读,而非跨多张图表的比较推理。为填补这一空白,我们提出 ChartDiff,首个面向跨图表比较式摘要的大规模基准。ChartDiff 包含8,541对图表,覆盖多样的数据来源、图表类型与视觉风格,每对图表均配有由 LLM 生成并经人工核验、描述其在趋势、波动与异常上差异的摘要。基于 ChartDiff,我们评估了通用模型、图表专用模型与流水线式模型。结果显示,前沿通用模型取得最高的基于 GPT 的质量评分,而专用模型与流水线式方法获得更高的 ROUGE 分数但更低的人类一致性评估,揭示了词面重叠与实际摘要质量之间的明显错位。我们进一步发现,多序列图表在各个模型家族中仍是难题,而强大的端到端模型对绘图库差异则相对鲁棒。总体而言,我们的发现表明比较式图表推理对当前视觉-语言模型仍是一项重大挑战,并将 ChartDiff 定位为推进多图理解研究的新基准。

ChartDiff:面向图表对理解的大规模基准:论文配图
图 1:ChartDiff 数据集说明。该任务需要比较两个图表并生成其差异的简明描述。更多示例可以在附录 A 中找到。