论文

视觉语言模型中推理与感知的非对称优化 后训练

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

模型训练监督微调与指令调优

摘要

后训练 极大地改进了前沿视觉语言模型的推理,但其在感知方面的收益仍然相对有限,为端到端视觉推理造成了瓶颈。为了研究这一差距,我们引入了一个受控诊断框架,其中包含两个综合任务,将感知与推理分开。我们的分析揭示了一致的感知推理不对称性:后训练 比感知更能显着提高推理能力,尽管不同训练范式的基本机制有所不同。对于受监督的 微调 (SFT),这种不对称源于词元不平衡,感知在思想链监督中只占词元的一小部分。重新加权损失可使端到端性能提高多达 18.2 个百分点。对于强化学习(RL)来说,不对称性是由奖励耦合引起的,因为结果奖励与推理的相关性比与感知的相关性更强。添加感知感知奖励可将端到端准确性提高高达 6.0 分;当 真值 感知奖励不可用时,可靠的代理提供有用的信号,产生 2.2 点的增益。除了受控设置之外,这些策略还可以改善现实世界的视觉推理,在三个基准测试中提升高达 3.3 分。总的来说,我们诊断了不对称优化的原因,并提供了有利于合成和现实设置的可行指导。