论文

谁值得获得奖励?SHARP:基于 Shapley 信用的多智能体系统优化

Who Deserves the Reward? SHARP: Shapley Credit-based Optimization for Multi-Agent System

模型训练强化学习Agentic RL

摘要

通过多智能体系统将大语言模型(LLM)与外部工具集成,为分解和解决复杂问题提供了有前景的新范式。然而,由于贡献归因难题,训练这类系统仍然出了名地困难:通常不清楚哪个具体功能智能体应对决策轨迹的成败负责。现有方法通常依赖稀疏或全局广播的奖励,无法捕捉个体贡献,导致强化学习效率低下。为解决这些局限,我们提出 SHARP(Shapley-based Hierarchical Attribution for Reinforcement Policy),一个通过精确信用归因来优化多智能体强化学习的新框架。SHARP 通过在轨迹组之间归一化各智能体的优势来有效稳定训练,主要依靠一个分解的奖励机制,包括全局广播准确率奖励、面向每个智能体的基于 Shapley 的边际信用奖励,以及用于提升执行效率的工具过程奖励。在多个真实世界基准上的大量实验表明,SHARP 显著优于近期的最先进基线,较单智能体与多智能体方法分别取得平均 23.66% 与 14.05% 的匹配提升。

谁值得获得奖励?SHARP:基于 Shapley 信用的多智能体系统优化
图2:SHARP框架概览。该流程包括:(a) planner agent与worker agent之间通过共享策略进行的层级交互;(b) 整合全局准确率、边际信用与工具过程奖励的三方奖励系统;(c) 借助Shapley值分离各agent贡献的边际信用机制;(d) 使用组相对策略实现稳定对齐的SHARP工作流程。