论文

VFIG:使用视觉语言模型对 SVG 中的复杂图形进行矢量化

VFIG: Vectorizing Complex Figures in SVG with Vision-Language Models

应用与实践内容创作

摘要

可扩展矢量图形 (SVG) 对于技术插图和数字设计至关重要,可提供分辨率独立性和语义可编辑性。在实践中,原始矢量文件经常丢失,只留下难以修改的光栅化版本(例如 PNG、JPEG),而手动重建的成本却高得令人望而却步。自动光栅到 SVG 转换的进展受到两个差距的瓶颈:现有的 SVG 数据集以图标和装饰图形为主,缺乏专业图表的复杂性,而现有的基准依赖于像素或嵌入级相似性,无法捕获结构正确性(例如,连接断开、箭头放错位置)。我们通过针对以图表为中心的图形(例如模型架构、流程图、原理图)的配对贡献来缩小这两个差距。对于训练,我们引入了 VFIG-Data,这是同类中最大的图形到 SVG 数据集,有 66K 对,它将通过描述和生成管道转换的真实纸质图形与程序图相结合,为箭头样式、字体和几何图形提供无噪声监督。为了进行评估,我们引入了 VFIG-Bench,这是一个结构感知评估套件,与 VFIG-Bench-OOD 搭配使用,VFIG-Bench-OOD 是一组从高引用率 arXiv 论文中手动整理的分布外数据集。除了像素和嵌入相似性之外,我们的协议还报告基于成对人类偏好评估的基于标题的 VLM-Judge 分数和 Elo 评级。基于这些贡献,VFIG 是一个 VLM 系列,接受了从简单到复杂的 SFT 课程训练,然后是具有渲染感知奖励的 RL。 VFIG 实现了最先进的开源性能,比最佳开源 VLM 基线高出 30% 以上,并与 VFIG-BENCH 上的 Claude Sonnet 4.6 相匹配:Gemini-Judge 78.2% vs. 76.7%,GPT-Judge 87.5% vs. 87.4%。它仍然略微落后于最强的专有模型 GPT-5.2 和 Gemini-3。