论文

SVGEval:基于视觉的文本到 SVG 生成中的感知质量基准测试和评估框架

SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation

模型评测基准与评测资源

摘要

多模态大型模型越来越多地用于生成可缩放矢量图形 (SVG),但可靠的评估仍未得到充分探索。现有协议通常以代码为中心,或者在渲染 SVG 后借用光栅图像度量,这无法反映人类的感知,并且忽略了 SVG 特定的质量,例如几何和空间构成。我们推出了 SVGEval,这是一种基于视觉的多模式基准,用于人类对齐的 SVG 质量评估。 SVGEval 明确结合视觉渲染来评估模型是否可以判断渲染结果,而不仅仅是检查 SVG 代码,并提供通过专家细化的多轮人工标记获得的高质量注释。对代表性多模态模型的系统评估揭示了一个明显的差距:模型在语义对齐和美观方面表现相对较好,但在几何和布局相关的判断方面表现不佳。在 SVGEval 的基础上,我们训练了一个可解释的 SVG 质量评分器,它输出带有文本原理的多方面分数。消融表明,明确的视觉基础和推理监督至关重要,特别是对于空间和几何评估。 SVGEval 提供了可靠的测试平台和实用的评分器,用于评估和改进多模态模型时代的 SVG 生成。