论文

钓出搭便车者:经强化学习的并行推理Shapley奖励归因

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

模型训练奖励建模与过程监督

摘要

大语言模型(LLM)擅长多步推理,但当前并行推理方法常无法区分各推理路径的贡献:许多路径可能冗余、误导甚至有害,而结果级奖励一律同酬,导致学习信号含糊、训练不稳。我们提出Parallel Shapley,一个在多路径推理中归因细粒度路径级贡献的强化学习框架:把每条路径当作合作博弈中的玩家,用Shapley值量化边际贡献——以生成式奖励模型评估路径效用、以蒙特卡洛采样高效近似。在数学推理基准上的实验显示,Parallel Shapley超越现有基线,同时提供更稳定、更可解释的训练。该框架有效“钓出搭便车者”,按比例分配奖励并改进LLM的多路径推理。

钓出搭便车者:经强化学习的并行推理Shapley奖励归因:论文配图
图 2:并行 Shapley 管道概述。左:培训框架比较。 Parallel-R1 为所有路径分配统一的结果奖励,而 Parallel Shapley 为每个推理路径计算个性化的边际贡献。右:基于 Shapley 的奖励归因机制。我们通过蒙特卡罗对 MM 路径排列进行采样,计算每个排序下的边际贡献 Δjπm\Delta_{j}^{\pi_{m}},并将它们聚合以获得 phipathjMC\phi_{\text{path}_{j}}^{\text{MC}} 作为强化学习的路径级奖励。