论文
循环渲染:通过视觉自我反馈生成矢量图形
Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback
摘要
多模态 大语言模型 (MLLM) 在通过直接代码合成生成可扩展矢量图形 (SVG) 方面表现出了良好的能力。然而,现有的范例通常采用开环“盲画”方法,其中模型生成符号代码序列而不感知中间视觉结果。这种方法严重未充分利用 MLLM 视觉编码器中嵌入的强大视觉先验,将 SVG 生成视为一种脱节的文本序列建模任务,而不是集成的视觉空间任务。因此,模型很难推理部分画布状态和隐式遮挡关系,这些关系在视觉上是明确的,但在文本上却是模糊的。为了弥补这一差距,我们提出了 Render-in-the-Loop,这是一种新颖的生成范例,它将 SVG 合成重新表述为逐步的、视觉上下文感知的过程。通过将中间代码状态渲染到累积画布中,该模型显式地观察每一步不断变化的视觉上下文,利用动态反馈来指导后续生成。然而,我们证明,将这种视觉循环天真地应用于现成的模型并不是最理想的,因为它们无法利用增量视觉代码映射。为了解决这个问题,我们首先利用细粒度路径分解来构造密集的多步视觉轨迹,然后引入视觉自反馈(VSF)训练策略来在中间视觉状态上调节下一代原始数据。此外,提出了渲染和验证(RaV)推理机制来有效过滤退化和冗余图元。我们的框架在多模式基础模型上实例化,其性能优于标准 MMSVGBench 上强大的开放权重基线。这一结果凸显了我们的循环渲染范例对于文本到 SVG 和图像到 SVG 任务的卓越数据效率和泛化能力。