论文
OmniDiagram:通过视觉询问奖励推进统一图表代码生成
OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward
摘要
可编程图表生成范式正在快速演进,在结构化可视化中发挥着关键作用。然而,大多数现有研究局限于狭窄的任务形式和语言支持范围,限制了其对多样图表类型的适用性。在这项工作中,我们提出OmniDiagram,一个融合多种图表代码语言与任务定义的统一框架。为解决强化学习(RL)中代码逻辑与视觉保真度对齐的难题,我们提出一种名为Visual Interrogation Verifies All(Viva)的新型视觉反馈策略。不同于脆弱的基于语法的规则或像素级匹配,Viva通过生成式方法对渲染图表的视觉结构给予奖励。具体而言,Viva主动生成有针对性的视觉询问以审视图表的视觉保真度,并为优化提供细粒度反馈。这一机制促成自演化的训练过程,有效免除了对人工标注真值代码的需求。此外,我们构建了M3$^2$Diagram,这是首个大规模图表代码生成数据集,包含超过196k个高质量实例。实验结果证实,SFT与基于Viva的RL相结合,使OmniDiagram在图表代码生成基准上确立了新的最先进(SOTA)水平。
