论文

UniCoder:通过符号奖励和参考引导的代码优化实现统一的视觉到代码生成

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

模型训练强化学习

摘要

视觉到代码生成将科学绘图、矢量图形和网页转换为可执行脚本,需要一定程度的像素精确对齐,而标准多模式 大语言模型 (MLLM) 无法单独通过监督 微调 (SFT) 实现。虽然强化学习 (RL) 提供了弥补这一差距的理论途径,但其应用受到两个基本障碍的阻碍:(1) \textit{奖励粗糙度},其中 CLIP 分数等语义指标无法惩罚细粒度的元素偏差;(2) \textit{探索停滞},其中稀疏、异构的代码搜索空间阻止策略引导有效轨迹。为了克服这些限制,我们引入了 UniCoder,这是一个集成了两种新颖机制的统一 RL 框架。首先,我们提出 \textbf{Symbolic Attribute Alignment},它采用轻量级辅助 LLM 将生成的代码解析为离散的视觉属性(例如,十六进制颜色、坐标限制),从而实现密集的、按元素的奖励计算。其次,为了逃避局部最优,我们设计了 \textbf{Reference-Guided Code Optimization},一种将 真值 轨迹动态注入表现较差的采样轨迹组的策略,将盲目探索转变为指导策略改进。在 ChartMimic、UniSVG、Design2Code 和 ScreenBench 基准测试上进行的大量实验表明,我们的 8B 参数模型不仅超越了所有开源基准,而且还实现了与专有模型相当的最先进的性能,为通用视觉到代码合成建立了新的范例。