论文
Vision2Code:用于评估图像到代码生成的多域基准
Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
摘要
图像到代码生成测试视觉语言模型 (VLM) 是否能够恢复足够的图像结构以将其表达为可执行代码。现有的基准测试要么专注于狭窄的视觉领域,要么依赖于配对的可执行参考代码,要么依赖于错过特定领域重建错误的通用标准。我们推出 Vision2Code,这是一个用于多域图像到代码生成的无参考代码基准和评估框架。 Vision2Code 包含来自 15 个源数据集的 2,169 个测试示例,涵盖图表和绘图、几何图形、图表、科学图像、文档和 3D 空间场景。模型生成可执行程序,我们使用 VLM 评分器对源图像进行渲染和评分,该评分器具有数据集特定的评分标准和针对严重语义故障的确定性护栏。我们报告渲染成功诊断,将代码执行失败与重建质量分开。人类验证表明,该评估协议比通用视觉标准或嵌入相似性基线更符合人类判断。在九个开放权重和专有模型中,我们发现图像到代码的性能与领域相关:领先模型在常规图表和类似图形的视觉效果上表现良好,但在空间场景、化学、文档和电路式图表上仍然较弱。最后,我们表明评估器过滤的模型输出可以作为训练数据来提高图像到代码的能力,在没有配对源程序的情况下,Qwen3.5-9B 在基准测试中从 1.60 提高到 1.86。 Vision2Code 提供了一个可重复的测试平台,用于测量、诊断和改进图像到代码的生成。我们的代码和数据可在 https://image2code.github.io/vision2code/ 上公开获取。