论文
StructReward:面向自纠错多模态推理的高效结构化过程奖励
StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning
摘要
可验证奖励强化学习(RLVR)已成为改进多模态推理的有效方法。然而,现有大多数方法仅依据最终答案正确性以二元奖励评估整个响应,从而丢弃了中间推理步骤中可用的监督信号。过程奖励模型提供更细粒度的反馈,但通常依赖单独训练的验证器、高昂的思维链标注,或大语言模型(LLM)的在线评判。本文提出StructReward,一个通过结构化步骤级奖励对齐提供密集强化信号的计算高效框架。StructReward将每个生成的解表示为推理步骤序列,并使用轻量的数值、符号与词汇匹配规则将其与带过程标注的参考步骤对齐。对齐后的标签被聚合为密集过程奖励,并通过门控的组相对策略优化(GRPO)目标与最终答案一致性及输出有效性奖励相结合。我们进一步将策略采样回收用于响应比较与反思性自我纠正的补充监督,而非在策略更新后将其丢弃。另外,我们使用强大的LLM将采样的正确轨迹改写为面向反思的训练实例,进一步增强策略评估和完善自身推理的能力。由于奖励计算在线进行,无需额外的学习型验证器或外部LLM裁判,StructReward大幅降低了多模态强化学习的计算开销。实验结果表明,结构化过程监督与采样回收为自我改进的多模态推理提供了高效路径。
