论文

UniCAR-RL:在深入思考之前先看清视觉数学

UniCAR-RL: Seeing Better before Thinking Deeper in Visual Mathematics

模型训练强化学习

摘要

多模态大语言模型(MLLMs)在处理复杂的数学视觉推理时常因感知粒度不足而出现初始视觉幻觉,进而引发连锁推理错误。在传统端到端强化学习(RL)中,稀疏奖励无法将感知幻觉与逻辑错误解耦,阻碍了感知能力的针对性优化。而通过感知增强的思维链(CoT)数据进行微调成本高昂且易产生幻觉。本文提出UniCAR-RL,一种无需标注的强化学习框架。该框架在训练过程中显式解耦感知与推理的优化过程,实现二者独立且高效的优化。具体而言,UniCAR-RL包含三个协同分支:1)图文描述强化学习分支,通过验证器引导的推理验证来优化感知能力;2)推理强化学习分支,基于标准图像描述进行逻辑推理以阻止连锁错误;3)问答强化学习分支,保持原生端到端对齐,确保问答性能的鲁棒性。实验表明,UniCAR-RL仅使用原始短答案数据,显著提升了MLLMs在数学和视觉推理任务上的表现,并在不同架构和尺度上展现出强大的泛化能力。

UniCAR-RL:在深入思考之前先看清视觉数学:论文配图
图 1:提出方法的动机。 (a) 强调了 MLLM 在视觉数学推理中的感知瓶颈,但现有的 RL 方法很难解决它; (b) 介绍现有的感知增强方法及其局限性; (c) 提供了视觉数学推理任务上的错误分布的比较。