论文
ShapE-GRPO:面向多候选LLM训练的Shapley增强奖励分配
ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training
摘要
在推荐、头脑风暴和代码建议等用户-智能体交互场景中,大语言模型(LLM)常常生成一组候选建议,其目标是最大化整个候选集的集体效用,而非独立地最大化单个候选。然而,现有的强化学习后训练范式(如组相对策略优化GRPO)通常为集合中的每个候选分配相同的集合级标量奖励。这导致训练信号充满噪声:较差的候选会搭便车,坐享单个强候选产生的高奖励,从而导致次优探索。为解决这一问题,我们提出Shapley增强GRPO(ShapE-GRPO)。通过利用集合级效用的置换不变特性,我们从合作博弈论中推导出一种Shapley增强的表述,将集合级奖励分解为细粒度的、候选特定的信号。我们证明该表述保留了Shapley值的基本公理,同时以多项式时间复杂度保持计算高效。实验表明,ShapE-GRPO在多个数据集上持续优于标准GRPO,并在训练中加速收敛。
