论文

LegendBench:通过反事实干预进行图例理解的诊断基准

LegendBench: A Diagnostic Benchmark for Legend Understanding with Counterfactual Interventions

模型评测基准与评测资源

摘要

图例是图表理解的基础,因为可靠的解释需要将图例条目正确绑定到相应的视觉标记。虽然视觉语言模型(VLM)越来越多地应用于图表理解,但它们的图例理解很难通过聚合准确度来诊断,这可以通过肤浅的捷径来满足,并将图例特定的错误与其他推理失败混淆。为了实现细粒度诊断和受控测试,我们引入了 LegendBench,这是一种参数化基准测试和生成管道,可生成以图例为中心的目标测试用例。 LegendBench 贡献了 (1) 能力任务分类法,涵盖图例解析、图例基础、图例条件推理和图例感知弃权以本地化故障,以及 (2) 反事实组生成,其中每个基本图表在受控图例干预下产生多个变体,以探测模型不变性和敏感性。使用 LegendBench,我们评估通用 VLM 和专用图表模型并生成其功能配置文件,揭示可靠的图例到标记绑定和反事实一致性方面的持续瓶颈。然后,我们使用这些能力概况来指导有针对性的微调,证明针对瓶颈的干预措施可以有效缩小局部能力差距并推广到看不见的数据。我们进一步利用反事实设计来进行细粒度的诊断实验,分析编码通道效应、图例顺序快捷方式以及不同可见性下的弃权。