论文

以结构化接地思考:面向图表与视觉表格理解的感知强化学习

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

模型训练强化学习RLVR

摘要

能够用图像思考的多模态大语言模型(MLLM)常常依赖外部工具完成细粒度感知。然而这种依赖带来显著的推理延迟,并且无法有效弥合空间结构鸿沟——这是文本密集且结构关系型视觉(如图表与视觉表格)中的根本挑战,其中严格的相对空间排布绑定了文本元素。在没有外部工具的情况下,标准MLLM难以胜任此类细粒度视觉推理任务。为解决这些问题,我们提出TwSG(Think with Structured Grounding),一种新颖的细粒度图像感知框架,旨在把复杂图像上的工具使用能力内化到模型之中。TwSG将多步推理与微裁剪(micro-cropping)的收益蒸馏到推理时的单次高效前向传播中。具体而言,我们用MLLM在真值答案引导下识别关键区域,然后提示教师模型生成高质量的视觉问答(VQA)数据。这些细粒度的、基于区域的监督信号随后被蒸馏回全图表示。我们的训练流程分两个阶段:(1) 使用带焦点区域描述的多轮数据进行冷启动监督微调(SFT),以培养复杂推理与错误恢复能力;(2) 由新颖过程奖励机制TL-GRPO驱动的强化微调(RFT)阶段,鼓励策略性推理。跨多种MLLM架构的大量实验表明,TwSG降低了推理延迟,同时大幅提升准确率与鲁棒性,赋予模型原生的细粒度区域描述与灵活推理能力。

以结构化接地思考:面向图表与视觉表格理解的感知强化学习:论文配图
图1:冷启动 SFT 数据生成流程。