论文
ChartDiff:面向图表对理解的大规模基准
ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts
摘要
图表是分析推理的核心,但现有图表理解基准几乎只关注单图解读,而非跨多张图表的比较推理。为填补这一空白,我们提出 ChartDiff,首个面向跨图表比较式摘要的大规模基准。ChartDiff 包含8,541对图表,覆盖多样的数据来源、图表类型与视觉风格,每对图表均配有由 LLM 生成并经人工核验、描述其在趋势、波动与异常上差异的摘要。基于 ChartDiff,我们评估了通用模型、图表专用模型与流水线式模型。结果显示,前沿通用模型取得最高的基于 GPT 的质量评分,而专用模型与流水线式方法获得更高的 ROUGE 分数但更低的人类一致性评估,揭示了词面重叠与实际摘要质量之间的明显错位。我们进一步发现,多序列图表在各个模型家族中仍是难题,而强大的端到端模型对绘图库差异则相对鲁棒。总体而言,我们的发现表明比较式图表推理对当前视觉-语言模型仍是一项重大挑战,并将 ChartDiff 定位为推进多图理解研究的新基准。
