论文

别思考先看:经免推理对齐的多模态文档问答高效后训练

Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment

模型训练强化学习RLVR

摘要

带显式视觉落地的高效多模态文档问答——定位支撑每个答案的精确文档区域——仍是开放挑战。当前方法分两路:监督微调(SFT)需要大量标注数据并到达优化平台期;以推理为中心的强化学习(RL)依赖冗长的中间轨迹——膨胀推理token成本而无明确收益。我们引入Perception-RFT:一个把群相对策略优化(GRPO)应用于多模态文档问答的训练框架——绕过中间推理token、直接把视觉特征与结构化落地输出对齐。为严格评估推理的必要性,我们在相同奖励设置下构造推理变体。我们发现:启用推理的模型在训练期间抑制其推理轨迹——在4B参数规模收敛到直接的基于感知的策略,把每查询推理token长度降低60%以上,而启用推理的RL落后于仅感知训练。经对Qwen3-VL-4B优化动力学的细粒度分析:我们确认文本域后训练确立的SFT饱和与冷启动RL不稳定延伸到多模态,并识别先前未刻画的“落地分歧”——联合RL优化下两个分布外基准(4,828样本)上语义鲁棒性与几何精度之间的选择性权衡。我们进一步显示早期的SFT→RL转换以少65%的训练数据达到可比精度。

别思考先看:经免推理对齐的多模态文档问答高效后训练:论文配图
图 6:定性分析:SFT 与 Perception-RFT (ID)。在密集的财务文件中,SFT 经常会出现在附近的单词中。 RFT 通过捕捉像素边缘来纠正此问题。问题:“根据文本,收货方名称的值是多少?”地面实况:WEBER SHANDWICK (BSMG-CG) SFT:WEBER SHANDWICK (BSMG-CG) 676 NORTH ST CLAIR SUITE 1000 CHICAGO, IL, 60611(IoU 0.21 - 散装盒) 感知-RFT:WEBER SHANDWICK (BSMG-CG)(IoU 0.88 - 像素完美)