论文
MM-ReCoder:通过强化学习与自我纠正推进图表到代码生成
MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction
摘要
多模态大语言模型(MLLM)近来在图表到代码生成等多模态编码任务中展现出颇具前景的能力。然而,现有方法主要依赖监督微调(SFT),即让模型通过图表-代码对学习代码模式,却未让模型接触代码执行环境。此外,虽然通过执行反馈进行自我纠正为提升编码质量提供了一条潜在路径,但已有研究表明,即使是最先进的MLLM也难以实现有效的自我纠正。在本工作中,我们提出MM-ReCoder,一个通过强化学习(RL)训练并具备自我纠正能力的图表到代码生成模型。我们提出一种基于组相对策略优化(GRPO)的两阶段多轮自我纠正强化学习策略。第一阶段通过滚动共享的第一轮来增强模型的自我纠正能力,第二阶段则通过全轨迹优化提升编码能力。MM-ReCoder通过与环境交互并迭代纠正自身输出,学会生成更准确、更可执行的代码。我们在三个图表到代码基准上的结果证明了MM-ReCoder的最先进性能。
