论文

ViCo:面向视觉的编码与图表复制的自我反思

ViCo: Visual-oriented Coding with Self-Reflection for Chart Replication

模型训练强化学习

摘要

本文解决了生成符合人类撰写论文视觉标准的高质量学术图表的挑战。虽然现有的人工智能代理可以生成结构良好的文本和代码,但它们生成的可视化效果通常缺乏人类设计的风格和语义保真度。采用自我反射机制的高级编码代理表现出较差的视觉推理和有限的反射跟随,导致奖励信号稀疏,严重破坏了它们的强化学习(RL)。我们提出了 ViCo,一种面向视觉的编码训练框架,它采用迭代反射来逐步将生成的图表图像与参考对齐。我们首先引入一个自监督的预热阶段,它通过基于一致性的修剪增强蒙特卡罗树搜索,以合成高质量的反射轨迹,确保每个编码步骤严格遵循先前反射的结果。然后开发多步骤强化学习算法,使用反事实基线来估计每个细化周期内反思和行动步骤的优势,从而解决奖励稀疏性问题。为了在大规模训练中实现有效的奖励,我们提出了一种自动、多方面的评估框架,通过分层异构布局图结构评估图表的样式、布局和语义一致性。对三个公共基准的实验表明,经过 8B 模型训练的 ViCo 的性能接近具有足够反射能力的专有 LLM。