论文
别思考先看:经免推理对齐的多模态文档问答高效后训练
Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment
摘要
带显式视觉落地的高效多模态文档问答——定位支撑每个答案的精确文档区域——仍是开放挑战。当前方法分两路:监督微调(SFT)需要大量标注数据并到达优化平台期;以推理为中心的强化学习(RL)依赖冗长的中间轨迹——膨胀推理token成本而无明确收益。我们引入Perception-RFT:一个把群相对策略优化(GRPO)应用于多模态文档问答的训练框架——绕过中间推理token、直接把视觉特征与结构化落地输出对齐。为严格评估推理的必要性,我们在相同奖励设置下构造推理变体。我们发现:启用推理的模型在训练期间抑制其推理轨迹——在4B参数规模收敛到直接的基于感知的策略,把每查询推理token长度降低60%以上,而启用推理的RL落后于仅感知训练。经对Qwen3-VL-4B优化动力学的细粒度分析:我们确认文本域后训练确立的SFT饱和与冷启动RL不稳定延伸到多模态,并识别先前未刻画的“落地分歧”——联合RL优化下两个分布外基准(4,828样本)上语义鲁棒性与几何精度之间的选择性权衡。我们进一步显示早期的SFT→RL转换以少65%的训练数据达到可比精度。
