论文

RULER:SVG 生成的实例感知 Rubric 奖励

RULER: Instance-aware Rubric Rewards for SVG Generation

模型训练奖励建模与过程监督

摘要

从自然语言指令生成可扩展矢量图形 (SVG) 代码是一项开放式任务,没有绝对的视觉基础事实,导致评估和策略优化都没有可靠的信号。在自然图像上校准的标量指标(CLIP、美学)很难很好地传输到风格化的矢量内容,并且将它们重新用作 RL 奖励会触发奖励作弊。我们通过基于评分标准的评分来解决这两个限制。我们首先根据经验确定,无论是在样本之间还是在指令内,用多轴评分标准提示视觉语言判断与人类判断的相关性远远好于标量指标。基于这一发现,我们引入了 RULER(强化学习的实例感知评分标准),它将每条指令转换为跨越语义、视觉和风格轴的六个项目的实例感知评分标准;法官对 VLM 逐项进行评分,加权满意度形成通过组相对策略优化优化的细粒度奖励。由于标题仅源自文本,因此 RULER 既不需要配对的 SVG 基本事实,也不需要人类偏好标签。在 MMSVG-Illustration 和 MMSVG-Icon 上,RULER 将评分标准得分从 0.432/0.395 提升到 0.693/0.683,超越了专门的 SVG 专家,并与更大的 DeepSeek-V3 相匹配,并通过消融将评分标准设计识别为开放式 SVG 生成中 RL 的主动杠杆。项目页面可通过此 https URL 获取。