论文
钓出搭便车者:经强化学习的并行推理Shapley奖励归因
Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning
摘要
大语言模型(LLM)擅长多步推理,但当前并行推理方法常无法区分各推理路径的贡献:许多路径可能冗余、误导甚至有害,而结果级奖励一律同酬,导致学习信号含糊、训练不稳。我们提出Parallel Shapley,一个在多路径推理中归因细粒度路径级贡献的强化学习框架:把每条路径当作合作博弈中的玩家,用Shapley值量化边际贡献——以生成式奖励模型评估路径效用、以蒙特卡洛采样高效近似。在数学推理基准上的实验显示,Parallel Shapley超越现有基线,同时提供更稳定、更可解释的训练。该框架有效“钓出搭便车者”,按比例分配奖励并改进LLM的多路径推理。
