论文
VisEditBench:视觉语言模型可以根据多模式反馈编辑可视化代码吗?
VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?
摘要
视觉语言模型(VLM)在根据文本或视觉规范生成可视化代码方面表现出了强大的能力。然而,现实世界的可视化创作本质上是迭代的:用户经常修改现有的可视化以修复有缺陷的图表或使其适应所需的样式。现有的基准测试主要评估从头开始的生成,而多模式反馈的可视化代码编辑很大程度上尚未被探索。我们推出 VisEditBench,这是基于真实可视化工作流程和失败案例的 1,395 个人工注释可视化代码编辑任务的基准。 VisEditBench 涵盖两种实用设置:反馈引导修复(模型使用有缺陷或标记的图表以及文本反馈来修改可视化代码)和参考引导重新设计(模型修改代码以匹配目标图表图像)。对 20 个最先进的 VLM 的评估表明,可视化代码编辑仍然具有挑战性:Claude-4.6-Sonnet 实现了 74.46% 的最佳总体通过率,而大多数开源模型仍低于 50%。在基于视觉的风格适应方面表现尤其薄弱,Claude-4.6-Sonnet 仅达到 55.71%。为了建立强大的基线,我们进一步提出了 VisEditAgent,这是一个基于渲染的编辑框架,可以迭代地生成、执行、验证和细化候选编辑。 VisEditAgent 基于 GPT-4o 构建,将整体通过率从 55.75% 提高到 67.99%,证明了基于渲染的反馈对于忠实可视化编辑的重要性。我们将在 https://github.com/vis-nlp/VisEditBench 发布 VisEditBench。