论文

OpenVLThinkerV2:用于多域视觉任务的通用多模态推理模型

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

模型训练强化学习

摘要

组相对策略优化 (GRPO) 已成为事实上的强化学习 (RL) 目标,推动了多模式 大语言模型 的最新进展。然而,将这一成功扩展到开源多模态通才模型仍然受到两个主要挑战的严重限制:不同视觉任务中奖励拓扑的极端差异,以及平衡细粒度感知与多步推理能力的固有困难。为了解决这些问题,我们引入了高斯 GRPO (G$^2$RPO),这是一种新颖的 RL 训练目标,用非线性分布匹配代替标准线性缩放。通过在数学上强制任何给定任务的优势分布严格收敛于标准正态分布 $\mathcal{N}(0,1)$, G$^2$RPO 理论上可确保任务间梯度公平,减轻重尾异常值的脆弱性,并为正和负奖励提供对称更新。利用 G$^2$RPO 提供的增强的训练稳定性,我们引入了两种任务级塑造机制来无缝平衡感知和推理。首先,响应长度整形动态地引发复杂查询的扩展推理链,同时强制直接输出以增强视觉基础。其次,熵整形紧密限制了模型的探索区域,有效防止熵崩溃和熵爆炸。整合这些方法,我们提出了 OpenVLThinkerV2,一种高度稳健的通用多模态模型。跨 18 个不同基准的广泛评估表明,其性能优于强大的开源和领先的专有前沿模型。