论文

DPBench:大语言模型与同时协调的斗争

DPBench: Large Language Models Struggle with Simultaneous Coordination

智能体系统Agent任务评测

摘要

大语言模型越来越多地部署在多智能体系统中,但我们缺乏测试它们是否可以在资源争用下进行协调的基准。我们引入了 DPBench,这是一个基于哲学家就餐问题的基准,用于评估大语言模型在不同决策时间、小组规模和沟通的八种条件下的协调性。我们使用 GPT-5.2、Claude Opus 4.5 和 Grok 4.1 进行的实验揭示了一个惊人的不对称性:LLM 在顺序设置中有效协调,但在必须同时做出决策时失败,在某些情况下死锁率超过 95%。我们将这种失败追溯到收敛推理,即代理独立地得出相同的策略,这些策略在同时执行时会导致死锁。与预期相反,启用通信并不能解决这个问题,甚至会增加死锁率。我们的研究结果表明,需要并发资源访问的多代理 LLM 系统可能需要外部协调机制,而不是依赖紧急协调。 DPBench 作为开源基准测试发布。代码和基准可在 https://github.com/najmulhasan-code/dpbench 获取。