论文

所见即所得:图表到代码生成的观察对齐监督

What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation

模型训练监督微调与指令调优

摘要

图表到代码的生成通常通过受监督的 微调 在参考绘图脚本上进行训练,隐式地将标准参考代码视为完全可观察的目标。然而,许多图表程序包含无法从渲染图像中唯一恢复的潜在变量。我们在五种图表类型中以四种形式识别了这种潜在的观察不匹配:聚合引起的不匹配,其中原始样本被简化为框统计或直方图箱质量;归一化引起的不匹配,其中饼图中的绝对比例被删除;投影引起的不匹配,其中 3D 信息通过 2D 渲染丢失;以及水平集引起的失配,其中标量场只能通过选定的轮廓线观察到。这些不匹配会引入目标模糊性,并需要模型生成图像不支持的信息。我们提出观察对齐监督,用视觉限制的数量代替潜在变量。我们使用框统计、箱权重和楔形比例对其进行实例化,并通过受控实验研究 3D 散点图和等值线图。在多个 VLM 中,观察对齐监督通常可以提高可执行评估中的可观察值恢复,并且主要提高端到端恢复,而轮廓研究揭示了观察对齐和表征紧凑性之间的权衡。