论文

视力不好还是思想不好?奖励视觉语言推理的感知

Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning

模型训练强化学习

摘要

实现稳健的感知-推理协同是先进视觉语言模型(VLM)的核心目标。近期进展通过架构设计或智能体工作流追求这一目标。然而,这些方法要么受限于静态文本推理,要么因外部智能体复杂性带来的巨大计算与工程负担而变得复杂。更糟的是,这种巨额投入并未带来成比例的收益,感知与推理之间常出现“跷跷板效应”。这促使我们对真正的瓶颈进行根本性反思。在本文中,我们认为这种权衡的根本原因在于模态贡献归因的模糊性:当VLM失败时,究竟是感知缺陷(“看错”)还是逻辑缺陷(“想错”)?为解决这一问题,我们引入一个强化学习框架,通过可靠地奖励感知保真度来改善感知-推理协同。我们显式地将生成过程分解为交替的感知与推理步骤。这种解耦使对感知的针对性监督成为可能。至关重要的是,我们引入感知验证(Perception Verification,PV),利用“蒙眼推理”代理来独立于推理结果地奖励感知保真度。此外,为了在自由形式的视觉语言(VL)任务上扩展训练,我们提出结构化言语验证(Structured Verbal Verification),用结构化算法执行取代高方差的LLM评判。这些技术被整合进模态感知贡献归因(MoCA)机制,将奖励路由到具体的错误来源——要么是看错,要么是想错——使单一VLM能在广泛任务范围内同时取得性能提升。

视力不好还是思想不好?奖励视觉语言推理的感知
图 1:MoCA 概述。 MoCA 通过区分感知和推理来区分“不良视觉”和“不良思维”。我们引入感知验证(PV,顶部循环),它使用“蒙住眼睛”的文本推理器代理来奖励 VLM 的感知,而与其推理无关。这与结果验证(OV,底部循环)相结合,可以奖励更好的感知推理协同作用。为了实现经济的实现,我们对 PV 和 OV 使用相同的验证器。