论文
GVR-Coder:用于在复杂文档和会议场景中生成结构化 SVG 的视觉反馈框架
GVR-Coder: A Visual-Feedback Framework for Structured SVG Generation in Complex Document and Meeting Scenarios
摘要
在要求苛刻的专业环境和会议评审场景中,冗长的文本往往会带来很高的认知负荷。为了促进有效的信息沟通,将冗长的文本转换为逻辑清晰的图表至关重要。可扩展矢量图形 (SVG) 由于其可编辑性和分辨率独立性,为此目的提供了有效的表示。然而,当前文本到 SVG 生成的研究仍然受到三个主要挑战的阻碍:(1)复杂、逻辑丰富的图表数据集的稀缺; (2)缺乏明确的布局先验,导致空间排列混乱; (3) 缺乏细粒度的视觉反馈来验证渲染输出并纠正美学缺陷。为了应对这些挑战,在数据层面,我们引入了 DocMeetSVG-100K,这是一个为文档创作和会议审阅场景量身定制的大型 SVG 数据集。在模型层面,我们提出了 GVR-Coder,这是一种新颖的框架,旨在从冗长的专业文本生成高质量的逻辑图。具体来说,我们采用课程驱动的拒绝采样 微调 来逐步增强模型对复杂结构进行建模的能力,同时在训练期间明确纳入布局约束知识。此外,我们还引入了双重渲染反馈的强化学习,这是一种通过奖励信号提供隐式反馈的机制,以共同优化结构复杂性和视觉美感。此外,我们设计了一个生成-验证-修复代理循环,它通过明确的、细粒度的反馈和有针对性的细化来提高生成质量。大量实验表明,GVR-Coder 的性能优于竞争基线,并可靠地生成逻辑连贯且视觉上吸引人的图表。代码和数据可在 https://github.com/CurryaNa/GVR-Coder 获取。