论文
ProcessThinker:通过基于轨迹采样的过程奖励增强多模式 大语言模型 推理
ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward
摘要
视觉问答越来越需要多步骤推理。最近的 后训练 在可验证奖励(RLVR)和组相对策略优化(GRPO)下使用强化学习可以改善多模态推理,但大多数方法依赖于稀疏的仅结果奖励。因此,他们很难判断错误的答案是来自推理后期的小错误,还是来自从一开始就无益的轨迹。常见的解决方案是训练用于步骤级监督的过程奖励模型(PRM),但这通常需要大规模高质量的思想链注释和额外的训练成本。我们提出了 ProcessThinker,这是一种实用的 后训练 管道,可以提供步骤级过程奖励,而无需训练显式的 PRM。 ProcessThinker 首先将推理跟踪重写为冷启动监督 微调 的步骤标记格式,然后应用带有标准格式奖励和我们基于轨迹采样的过程奖励的 GRPO。具体来说,对于每个中间步骤,我们从该步骤中采样多个延续,并使用经验成功率(最终答案验证)作为步骤奖励。这提供了密集的学分分配,并鼓励更可靠地支持正确结论的推理步骤,有助于减少步骤之间不一致或自相矛盾的进展——这是逻辑推理中的一个关键问题。在四个具有挑战性的视频基准测试(Video-MMMU、MMVU、VideoMathQA 和 LongVideoBench)中,ProcessThinker 持续改进基准模型 Qwen3-VL-8B-Instruct