论文
图表超越像素:探索分层图表理解和编辑
Charts Are Beyond Pixels: Probing for Layer-Wise Chart Understanding and Editing
摘要
图表是结构化的视觉组合,其元素具有不同的功能角色、语义对应和可见性关系。这种结构视图促使评估模型是否可以理解和操作图层级别的图表。然而,现有的图表基准主要评估最终输出的正确性或保真度,而不直接评估这些分层行为。我们推出了 LayerWiseBench,这是一个围绕三个核心概念(图层属性、图层绑定和可见性排序)组织的基准,它构建了图表理解和图表编辑评估。 LayerWiseBench 由可执行的图表程序生成,将每个渲染的图表与空间对齐的每层 RGBA 资产以及功能角色、语义绑定和可见性关系的构造衍生标签配对。从这种分层表示中,我们得出受控理解问题、编辑目标、参考图像和评估区域。它包含跨 14 个图表范式的 2,800 个源图表,从中我们得出 7,329 个分层理解问题和 53,791 个指令引导的编辑变体。在评估的VLM中,Qwen3.5-27B实现了最高的QA宏观平均,在层归因上获得了93.04%的准确度,在层绑定上获得了97.46%的准确度,但在可见性排序上仅获得了61.46%的准确度。在四个评估的图像编辑器中,总体 mIoU 范围为 1.49% 到 4.93%,可见性受限编辑的 mIoU 最低,范围为 0.37% 到 2.00%。总而言之,这些结果将涉及重叠组件之间的前后关系的任务确定为理解和编辑过程中反复出现的挑战,从而激发了对组件身份和可见性关系进行更明确的建模。