论文

Chart-RL:基于策略优化强化学习的视觉语言模型图表问答视觉推理增强

Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models

模型训练强化学习

摘要

视觉语言模型(VLM)的最新进展展示出向真正智能迈进的步伐,而真正智能需要强健的推理能力。超越模式识别,语言推理必须与视觉理解相结合,对于涉及复杂数据可视化的图表问答(CQA)任务尤其如此。当前VLM在CQA上面临显著局限,包括数值提取不精确、难以解读隐式视觉关系,以及注意力机制不足以捕捉图表中的空间关系。在本工作中,我们通过提出Chart-RL来应对这些挑战,这是一个新颖的强化学习框架,通过对视觉感知与逻辑推理进行反馈驱动的策略优化来增强VLM的图表理解。我们的关键创新包括一个综合框架,它将基于策略优化技术的强化学习(RL)与自适应奖励函数相结合,相比基座基础模型展现出更优性能,并与更大规模的最新架构相比具有竞争力。我们还在RL框架中集成了基于低秩适应(LoRA)的参数高效微调,只需单GPU配置即可保持性能完整。我们利用ChartQAPro数据集,在开源、专有与最先进的闭源模型上开展了广泛评测。经RL微调的Qwen3-VL-4B-Instruct模型取得了0.634的回答准确率,尽管参数量只有一半,仍超越了Qwen3-VL-8B-Instruct基座模型的0.580准确率,同时将推理延迟从31秒降至9秒。