论文
SVG-Score:与人类判断对齐的文本到SVG生成评估
SVG-Score: Human-Aligned Evaluation of Text-to-SVG Generation
摘要
随着生成模型的表现力和可控性不断提高,可扩展矢量图形 (SVG) 生成越来越受到关注。然而,由于缺乏特定领域的评估协议,进展受到阻碍:当前的实践依赖于为自然图像设计的指标,最著名的是 CLIPScore,它从未接受过矢量图形训练,并且仅部分与人类判断一致。我们引入了 \textbf{\ours},一个用于文本到 SVG 生成的人性化评估框架。通过受控的标题和图像扰动,我们首先表明基于 CLIP 的分数几乎不会对 SVG 生成器实际产生的错误做出反应,例如错误的颜色、计数和空间关系,并且现成的视觉语言模型 (VLM) 判断虽然更敏感,但对错误类型和 SVG 样式的响应不均匀。然后,我们为 \textit{语义对齐} 引入人工注释的数据集,测量生成的 SVG 反映其标题的忠实程度。在此基础上,我们开发了两个互补的评估器:适应矢量图形并符合人类偏好的 CLIP 评分器,用于快速大规模评估;以及经过监督微调和奖励形状强化学习训练的 VLM 判断器,用于更具表现力和可解释性的评估。使用这两者,我们在独立的字幕集上对主要开源、商业和基于优化的 SVG 生成器进行基准测试。
