论文
ChartFI:忠实性 基准测试和多模式 大语言模型 图表描述的洞察力
ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models
摘要
图表描述对于可访问性、跨模式检索以及帮助读者从复杂的可视化中提取见解至关重要。随着多模态 大语言模型 (MLLM) 越来越多地用于自动图表描述生成,出现了一个关键问题:这些模型实际上如何忠实和深入地描述图表?当前的基准在两个方面存在不足:现有数据集由简单、同质的图表和浅薄的事实枚举描述组成;流行的指标无法捕捉描述质量的多面性。为了解决这些差距,我们提出了图表 忠实性 和洞察力基准 (ChartFI-Bench)。我们首先总结了高质量图表描述的四个维度:事实准确性、显着特征强调、领域知情指导和图表文本互补性。在这些维度的指导下,我们构建了一个由 896 个图表描述对组成的高质量基准,其特点是视觉上复杂的图表和语义上丰富的描述。此外,我们设计了四个一致的评估指标——忠实性、覆盖率、信息性和敏锐度——以系统地评估这些维度的描述质量。在主流 MLLM 上进行的实验证明了所提出框架的有效性,并揭示了现有模型的共同弱点。