论文

从看到到思考:感知和推理的解耦改进了视觉语言模型的 后训练

From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

模型训练监督微调与指令调优

摘要

视觉语言模型(VLM)的最新进展强调长链思维推理;然而,我们发现他们在视觉任务上的表现主要受到缺乏视觉感知而不是推理本身的限制。在这项工作中,我们系统地研究了 VLM 后训练 中感知和推理之间的相互作用,将其能力分解为三个独立的训练阶段:视觉感知、视觉推理和文本推理,并结合专门的训练数据。我们证明视觉感知 (a) 需要使用专门数据进行有针对性的优化; (b) 作为基本支架,在完善视觉推理之前应通过分阶段训练来巩固; (c) 通过 RL 学习比基于字幕的 SFT 更有效。我们在多个 VLM 上进行的实验表明,与合并训练相比,分阶段训练能够持续提高视觉感知和推理性能。值得注意的是,使用我们的方法训练的模型的推理精度提高了 1.5%,推理轨迹缩短了 20.8%,这表明卓越的感知减少了过度推理的需要。此外,我们表明,这种基于能力的分期代表了与传统的基于难度的课程正交的新课程维度,并且将两者结合起来会产生进一步的附加收益。我们的分阶段训练模型在开放权重 VLM 中实现了卓越的性能,与基础对应模型相比,在多项视觉数学和感知任务上取得了先进的结果(例如,WeMath 上 +5.2%,RealWorldQA 上 +3.7%)任务。