论文

RefineSVG:用于图像到 SVG 生成的视觉反馈驱动的强化学习

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

模型推理推理验证与自校正

摘要

我们提出了RefineSVG,这是一种单步闭环视觉反馈框架,使多模态 大语言模型 (MLLM) 能够通过自我校正执行高保真图像到 SVG 的生成。现有的基于 MLLM 的方法依赖于单通道开环推理,其中模型仅接收一次视觉输入,并且必须生成数千个 SVG 代码标记,而无需中间验证。这种范式不可避免地导致复杂图像上的几何漂移、误差累积和视觉幻觉。 RefineSVG 通过在初始 SVG 生成过程后调用外部渲染引擎来将渲染输出与目标图像进行比较,从而克服了这一限制。比较产生多维视觉残差图 (Diff-Map),该图作为 ReAct 式校正信号反馈到模型,驱动有针对性的校正步骤。为了支持这种渲染-观察-正确交互,我们进一步引入了面向 SVG 的语义词汇表,可将标记序列压缩超过 52%。跨越监督 微调、拒绝采样冷启动数据构建和端到端代理强化学习的渐进式训练管道使模型与闭环视觉校正保持一致。大量实验表明,RefineSVG 在重建保真度、结构准确性和代码效率方面始终优于现有基线。代码可在 https://github.com/liuxiaobo66/RefineSVG 获取。