论文

与你同看:面向多模态推理的感知-推理协同演化

Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning

模型训练强化学习RLVR

摘要

带可验证奖励的强化学习(RLVR)已大幅提升了多模态大语言模型(MLLM)的推理能力。然而,现有 RLVR 方法通常依赖结果驱动的优化,仅基于最终答案的共享奖励同时更新感知与推理。这种共享奖励模糊了功劳分配,往往改进了推理模式,却未能可靠提升上游视觉证据抽取的准确率。为突破这一感知瓶颈,我们提出 PRCO(Perception-Reasoning Coevolution,感知-推理协同演化),一个共享策略的双角色 RLVR 框架。PRCO 由两个协作角色构成:Observer 生成贴合问题的证据描述(caption),Solver 基于该描述预测最终答案。关键在于,PRCO 采用角色专属的奖励信号:Solver 使用最终答案上可验证的结果奖励进行优化,而 Observer 则获得由 Solver 下游成功推导出的效用奖励。在八个具有挑战性的多模态推理基准上的大量实验表明,PRCO 在各模型规模上均带来一致提升,平均准确率较基座模型提高超过7个百分点,优于以往开源的 RL 调优基线。

与你同看:面向多模态推理的感知-推理协同演化:论文配图
图1:GRPO在WeMath上的诊断:推理错误降幅远大于感知错误,右侧为感知错误导致的典型失败案例,凸显感知瓶颈。