论文
GRPO 并未缩小多代理协调差距
GRPO Does Not Close the Multi-Agent Coordination Gap
摘要
我们使用哲学家就餐问题作为干净的测试平台,测量当前 大语言模型 在多个代理共享公共资源时的协调程度。在涵盖七个模型和三个哲学家计数的 630 个剧集中,四个前沿闭源系统达到平均奖励 0.45 到 0.87,Mistral-Small 24B 达到 0.83 到 0.99,而 Qwen3-14B 达到 0.13 到 0.35。然后,我们询问从任务本身执行轨迹的组相对策略优化 (GRPO) 是否可以缩小差距,结果发现它不能:对 5 位哲学家的每集奖励进行 Welch t 检验,得到 p = 0.66,Hedges g 为 -0.11,在 10 名或 15 名哲学家中也没有统计上显着的变化。两个进一步的观察证实了结果。 8B 和 14B 运行的训练奖励在第 9 步达到峰值,然后下降,因此第 15 步默认保存的检查点明显比之前的几个检查点差。我们使用的四项奖励承认零行动时的退化最大值,五个哲学家的 DeepSeek-R1-Distill-Qwen-7B 和 Mistral-Small 24B 都存在这种情况,零餐时的平均奖励分别为 1.0 和 0.83。多智能体协调的开放权重 14B 模型的瓶颈不是训练计算,而是训练方法:不会崩溃到无操作最大值的奖励塑造、不依赖于最后步骤的检查点规则以及跨问题规模的课程。