论文

SVG-Score:与人类判断对齐的文本到SVG生成评估

SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation

模型评测评测方法与指标

摘要

随着生成模型的表现力和可控性不断提高,可扩展矢量图形 (SVG) 生成越来越受到关注。然而,由于缺乏特定领域的评估协议,进展受到阻碍:当前的实践依赖于为自然图像设计的指标,最著名的是 CLIPScore,它从未接受过矢量图形训练,并且仅部分与人类判断一致。我们引入了 \textbf{\ours},一个用于文本到 SVG 生成的人性化评估框架。通过受控的标题和图像扰动,我们首先表明基于 CLIP 的分数几乎不会对 SVG 生成器实际产生的错误做出反应,例如错误的颜色、计数和空间关系,并且现成的视觉语言模型 (VLM) 判断虽然更敏感,但对错误类型和 SVG 样式的响应不均匀。然后,我们为 \textit{语义对齐} 引入人工注释的数据集,测量生成的 SVG 反映其标题的忠实程度。在此基础上,我们开发了两个互补的评估器:适应矢量图形并符合人类偏好的 CLIP 评分器,用于快速大规模评估;以及经过监督微调和奖励形状强化学习训练的 VLM 判断器,用于更具表现力和可解释性的评估。使用这两者,我们在独立的字幕集上对主要开源、商业和基于优化的 SVG 生成器进行基准测试。

SVG-Score:与人类判断对齐的文本到SVG生成评估:论文配图
图1: SVG-核心评价框架概览。我们收集了两个资源(左边):一个是文阶语义对齐数据集,用于字幕-SVG评级;另一个是基准,有三个难度。然后,我们培训了两名补充评价员:人际关系SVG-CLIP评分员(中)和一位受SFT和GROPO培训的VLM法官,他们使用常规和排名奖励(右)。