论文
ChartAnno:评估多模态LLM生成图表标注的能力
ChartAnno: Evaluating MLLMs for Chart Annotation Generation
摘要
多模态大语言模型(MLLM)在图表理解、生成和编辑方面取得了显著进展,但它们的标注现有图表的能力尚未得到充分探索。标注图表是一项常见的且具有挑战性的交际任务,要求模型推断意图消息、解读图表语义,并放置适当的文本或图形元素。为解决这一差距,我们引入了ChartAnno基准,用于评估MLLMs在图表注释生成上的能力。该基准包含1,200个带有配对代码和注解说明的现实世界图表,覆盖三个级别的指令具体性。我们评估了10个代表性MLLM模型,在两种主要输入设置下进行测试:(1)仅图表代码和(2)图表代码与图表图像,并进一步包括一个图表图像缺失的对比研究。结果表明,专用模型在整体上表现更强,尽管大规模开源模型缩小了差距。更具体的指令改善了注解质量,而推断抽象意图仍然是当前MLLMs中最困难的任务。提供图表图像带来了总体上的有限改进,主要出现在设计相关的指标中。这些发现强调了图表注释生成作为一项需要语义基础和有效注解设计的挑战性任务。代码和数据将在未来版本中公开。
