论文
通过词元级感知优势估计强化多模态推理
Reinforcing Multimodal Reasoning via Token-Level Perception-Grounded Advantage Estimation
摘要
可验证奖励的强化学习 (RLVR) 提高了多模态大语言模型 (MLLM) 的推理能力,但现有框架依赖于粗略的序列级奖励信号,缺乏对多模态推理链中基于视觉的步骤的细粒度监督。我们通过两个词元级指标来研究这一差距:视觉依赖性(即词元的预测对输入图像特征的依赖程度)和预测熵。我们的实证分析揭示了两个关键发现:(1)与不正确的推理链相比,随着视觉基础的加强,正确的推理链表现出明显更急剧的熵减少; (2)关键标记,即那些错误预测引发推理崩溃的标记,是来自正确链的视觉依赖性和预测熵联合分布中的统计异常值。受这些发现的启发,我们提出了基于感知的词元级优势估计(TPAE),它通过测量每个词元与正确rollout的视觉熵模式的统计一致性来估计词元级优势。 TPAE 利用这种粒度分数来调节序列级优势,产生可以集成到各种 RLVR 框架中的细粒度监督信号。对七个基准的大量实验表明,TPAE 始终优于领先的强基线,为多模态推理带来更稳定、更高效的优化。该代码可在 https://github.com/Zhihan72/TPAE. 公开获取