论文

使用现成的 VLM 评估可扩展矢量图形生成的约束迭代细化

Evaluating Constrained Iterative Refinement for Scalable Vector Graphics Generation with Off-the-Shelf VLMs

模型评测模型能力评测

摘要

可扩展矢量图形 (SVG) 为现代视觉生态系统的大部分提供了动力,但最先进的生成模型几乎完全专注于光栅化图像。我们探索推理时间方法是否可以在现成的视觉语言模型 (VLM) 中解锁 SVG 生成功能。我们系统地评估了约束迭代细化工具,该工具结合了视觉反馈、结构化编辑和约束解码,以表征当前 VLM 用于 SVG 生成的功能和局限性。在多个 VLM 和生成设置中,我们发现受限解码提高了编译成功率,而迭代细化则揭示了视觉推理和自我纠正方面的缺陷。我们的结果强调了使用推理时间方法来调整通用 VLM 来生成 SVG 的前景和当前局限性。