论文

VCG-Bench:面向结构化生成和编辑的统一的以视觉为中心的基准

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

模型评测基准与评测资源

摘要

尽管视觉语言模型 (VLM) 取得了快速进步,但它们处理专业工作流程所必需的结构化、可控图表任务的能力仍然存在严重差距。现有方法主要依赖于基于像素的合成,该合成在概率像素空间中运行,并且在可编辑性和保真度方面本质上受到限制。相反,我们提出了一种具有符号逻辑的新图表即代码范例,该范例利用 mxGraph 可扩展标记语言 (XML) 进行精确的图表生成和编辑。我们推出了 VCG-Bench,这是一个以视觉为中心的 \texttt{mxGraph} 任务的统一基准。 VCG-Bench 包括:(1) 涵盖 6 个域和 15 个子域的 1,449 个不同图表的分类数据集,(2) 集成生成(视觉到代码)和可编辑性(代码到代码)的范式定义,(3) 采用多维指标的定制评估协议,例如 \texttt{mxGraph} 执行成功率、风格一致性得分 (SCS) 等。实验结果凸显了挑战当前最先进 (SOTA) VLM 在结构化保真度和指令合规性方面面临的挑战,反映了他们的视觉和推理能力。