论文

CURV:通过课程视觉基础推理增强图表理解

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

模型训练监督微调与指令调优

摘要

图表问答 (CQA) 需要多模态 大语言模型 (MLLM) 将视觉理解与逻辑推理相结合,但当前的模型在准确的视觉基础和连贯的推理链方面存在困难。虽然外在的思维链提示和视觉提示可以显着提高性能,但当前的 MLLM 缺乏内在的基于视觉的推理能力,导致与视觉证据脱节的不准确的感知和推理。为了解决这些局限性,我们提出了 CURV,一种课程学习框架,通过将 CQA 重新表述为多步骤视觉基础推理来开发内在视觉推理能力,其中每个步骤通过空间注意力集中来协调逻辑推理与动态视觉基础。为了协助模型学习,我们进一步引入了 CCQA,这是一个三级课程数据集,具有跨不同图表类型和推理模式的可扩展合成生成。我们的课程系统地从基本的单操作推理发展到复杂的多图表组合任务。实验表明,CURV 比基线实现了高达 $\uparrow20.50\%$ 的改进,并且可推广到现实世界基准(高达 $\uparrow12.30\%$)和域外多模态推理任务(高达 $\uparrow10.20\%$),验证了通过动态基础内化视觉推理以增强图表理解能力的有效性。代码位于:https://xhguo7.github.io/CURV/。