论文
Chart-FR1:通过视觉聚焦提升密集图表细粒度推理
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
摘要
多模态 大语言模型 (MLLM) 在图表理解和推理任务中显示出巨大的潜力。然而,由于三个主要挑战,他们仍然在处理以多个子图、图例和密集注释为特征的高信息密度 (HID) 图表:(1) 有限的细粒度感知导致忽略关键视觉提示; (2)冗余或噪声的视觉信息损害多模态推理的性能; (3)缺乏相对于视觉信息量的自适应深度推理。为了应对这些挑战,我们提出了一种新颖的聚焦驱动的细粒度图表推理模型 Chart-FR1,以提高 HID 图表的感知、聚焦效率和自适应深度推理。具体来说,我们提出了 Focus-CoT,这是一种视觉聚焦思想链,通过将推理步骤明确链接到关键视觉线索(例如局部图像区域和 OCR 信号)来增强细粒度感知。在此基础上,我们引入了 Focus-GRPO,这是一种焦点驱动的强化学习算法,具有信息效率奖励,可以压缩冗余视觉信息以实现高效聚焦,以及自适应 KL 惩罚机制,可以在发现更多视觉线索时灵活控制推理深度。此外,为了填补 HID 图表基准的空白,我们构建了 HID-Chart,这是一个具有挑战性的基准,其信息密度指标旨在评估细粒度图表推理能力。对多个图表基准的大量实验表明,Chart-FR1 在图表理解和推理方面优于最先进的 MLLM。代码可在 https://github.com/phkhub/Chart-FR1 获取。