论文

REChart:使用大型推理模型进行高效推理图表编辑

REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models

模型训练强化学习

摘要

图表编辑需要根据编辑指令从参考图表图像中推断和修改可视化代码,这对 MLLM 的细粒度视觉推理、指令跟踪和可执行代码合成能力提出了挑战。具有扩展思想链 (CoT) 推理的大型推理模型 (LRM) 适合处理此类复杂的多模态任务。然而,我们的初步研究揭示了推理长度和图表编辑性能之间的“倒U”关系:过度推理通常会导致“过度思考”,即模型转向幻觉的视觉细节或陷入冗余推理循环。为了解决这一问题,我们引入了 REChart,这是一个两阶段训练框架,可对中间推理步骤提供过程级监督,从而提高编辑保真度和推理效率。首先,我们使用角色专用的代理 Reason-Score-Refine 工作流程,从大型图像指令代码池中合成 200k 个用于监督 微调 的高质量推理轨迹,该工作流程迭代地细化图表代码以获得更高的质量。其次,我们通过强化学习使用两个互补的奖励来优化模型:一个评估代码正确性、视觉保真度和结构一致性的\emph{fidelity}奖励,以及一个\emph{efficiency}奖励,它为每条采样轨迹分配随机思维预算,截断推理过程,并根据最终推理部分对输出的贡献来计分。在 ChartEdit 和 ChartMIMIC 基准测试中,我们的模型在同等规模的开源模型中实现了最先进的图表编辑性能,同时与基本模型相比,在最大思维预算 16,384 个词元的情况下,减少了过度思考并将平均推理词元使用量减少了 79.0%。