论文

多代理过滤反馈下的边际贡献策略梯度 LLM

Marginal-Contribution Policy Gradients under Filtered Feedback for Multi-Agent LLMs

模型训练强化学习

摘要

我们为多智能体 LLM 系统中的 RL 训练开发了统一的学分分配处理方法。我们表明,仅观察到的奖励无法区分决定奖励的代理与从不影响奖励的代理,并且标准共享奖励训练对每个代理的私人效用而不是系统性能执行精确的梯度上升。此外,我们证明,一旦智能体交互,每个智能体没有一个标量能够一致地解释联合性能。因此,我们开发了满足自然一致性要求的独特的依赖于背景的边际贡献概念。从中我们得出梯度正确的边际贡献训练信号,从过滤后的反馈中识别它们,并针对学习到的信号误差优化分配精确反事实评估的预算。在 GRPO 中实例化后,我们的信号比赢家通吃的训练提高了路由 GSM8K 的准确性,而无需额外的生成成本。