论文

通过 VLM 驱动的分层语义解析生成组合 SVG

Compositional SVG Generation via VLM-Driven Hierarchical Semantic Parsing

应用与实践内容创作

摘要

虽然视觉语言模型 (VLM) 擅长视觉推理,但生成结构化、可编辑的可扩展矢量图形 (SVG) 仍然是一个基本挑战。现有的管道主要产生扁平的、语义不可知的路径集合,其中编辑单个对象需要手动识别其组成路径。为了解决这个问题,我们提出了一个 VLM 驱动的代理框架,用于语义组合 SVG 生成。我们的管道通过自上而下的分解、视觉基础和提示驱动的非模态遮挡恢复,递归地将视觉场景解析为语义和几何层次结构,确保每个组件在几何上都是完整的。此外,我们引入了语义 SVG 基准,其中包含人工注释的语义组和新颖的子组件度量(语义召回/精度、PERE),以明确评估结构组合性和功能可编辑性。实验表明,我们本地预测的结构在分组质量和可编辑性方面都超过了现有平面生成方法的上限,同时保持了最先进的视觉保真度。