论文

面向多模态推理的结构化角色感知策略优化

Structured Role-Aware Policy Optimization for Multimodal Reasoning

模型训练强化学习RLVR

摘要

基于可验证奖励(RLVR)的强化学习,尤其是组相对策略优化(GRPO),在提高大型视觉语言模型(LVLM)的推理能力方面表现出了巨大的潜力。然而,在多模态推理中,最终答案奖励通常是在序列级别分配的,并且不区分不同标记的功能角色,这使得很难确定正确答案是否得到任务相关视觉证据的支持。在本文中,我们从角色感知令牌级贡献归因的角度重新审视多模态 RLVR,其中结构化响应被分解为用于提取视觉证据的感知令牌和用于从该证据中得出答案的推理令牌。基于这个角度,我们提出了结构化角色感知策略优化(SRPO),它将序列级GRPO优势细化为角色感知令牌级优势,而不改变奖励函数。具体来说,SRPO 通过使用自我蒸馏的策略对比来分配特定于角色的信用:根据原始视觉输入与损坏的视觉输入下的视觉依赖性来强调感知标记,而根据其与生成的感知的一致性来强调推理标记。这些特定于角色的信号通过共享的轨迹水平基线进一步统一,产生正的令牌权重,调整相对更新幅度,同时保留原始的 GRPO 奖励和优化方向,而不需要外部奖励模型或单独的教师。跨不同多模态推理基准的实验表明,SRPO 改进了基于证据的推理,强调了超越统一序列级信用转向角色感知优化以实现可靠的多模态推理的重要性。

面向多模态推理的结构化角色感知策略优化:论文配图
图 2:SRPO 概述。 SRPO将每个在策略响应分解为感知和推理令牌,从验证者奖励中获得序列级优势,并将其转换为角色感知令牌级优势。感知标记通过视觉依赖性进行评分,而推理标记通过感知支持的基础一致性进行评分。所得分数产生用于令牌级别重新加权的有界正调制权重,并且策略优化还包括用于稳定性的响应令牌熵正则化器。