论文

面向多智能体协作的反事实贡献归因策略优化

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

协作多智能体大语言模型(LLM)可以通过分解角色和聚合不同的假设来解决复杂的推理任务。然而,此类系统的强化学习(RL)常常受到贡献归因的破坏:共享的全局奖励掩盖了个人的贡献,扩大了更新方差并鼓励搭便车。我们引入了反事实信用政策优化(CCPO),这是一个框架,通过反事实轨迹估计每个代理的边际贡献来分配特定于代理的学习信号。 CCPO 构建动态反事实基线,模拟去除代理贡献的结果,从而为策略优化带来角色敏感的优势。为了进一步提高异构任务和数据分布下的稳定性,我们提出了一种全局历史感知的标准化方案,该方案使用全局推出统计数据来校准优势。我们在两种协作拓扑上评估 CCPO:顺序思考-推理二元组和多智能体投票。在数学和逻辑推理基准中,CCPO 减少了搭便车现象,并优于强大的多智能体 RL 基线,为协作 LLM 训练提供更细粒度和更有效的贡献归因。我们的代码可在 https://github.com/bhai114/ccpo 获取。

面向多智能体协作的反事实信用策略优化:论文配图
图1:上图为不同协作模式下两个Agent在MATH500数据集上的准确率;下图为不同协作模式下三个Agent在LogiQA数据集上的准确率(S:qwen2.5-7b-instruct;L:qwen2.5-72b-instruct)。