论文

分层 SVG 标记化:学习用于可扩展矢量图形建模的紧凑视觉程序

Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modeling

应用与实践内容创作

摘要

最近的 大语言模型 将 SVG 生成从可微分渲染优化转变为自回归程序合成。然而,现有方法仍然依赖于从自然语言处理继承的通用字节级标记化,这很难反映矢量图形的几何结构。数字坐标被分割成离散符号,破坏了空间关系并引入了严重的标记冗余,通常会导致坐标幻觉和低效的长序列生成。为了应对这些挑战,我们提出了 HiVG,这是一种专为自回归矢量图生成而定制的分层 SVG 标记化框架。 HiVG 将原始 SVG 字符串分解为结构化的\textit{原子标记},并进一步将可执行命令参数组压缩为几何约束的\textit{段标记},从而在保持语法有效性的同时显着提高序列效率。为了进一步减轻空间不匹配,我们引入了分层均值噪声(HMN)初始化策略,该策略将数字排序信号和语义先验注入新的词元嵌入中。结合逐步增加程序复杂性的课程训练范例,HiVG 可以更稳定地学习可执行的 SVG 程序。对文本到 SVG 和图像到 SVG 任务的大量实验表明,与传统的标记化方案相比,生成保真度、空间一致性和序列效率得到了提高。我们的代码可在 https://github.com/ximinng/HiVG 上公开获取