论文

SwarmBench:大语言模型 可以充当代理 Swarm Orchestrator 吗?

SwarmBench: Can Large Language Models Act as Agent Swarm Orchestrators?

智能体系统Agent任务评测

摘要

基于 大语言模型 的多代理系统正在从固定交互拓扑发展到动态编排的代理群。然而,现有的基准测试仍然主要基于单代理或通用代理任务,因此很难系统地评估关键的编排能力。我们提出了 SwarmBench,这是一个从多个角度评估模型性能的基准,包括准确性、效率、成本和过程质量。实验结果表明,当前模型在编排能力方面表现出显着差异。这些差异不仅体现在最终的准确性、效率和成本上,还体现在编排过程本身的整体质量上。基于这些发现,我们进一步提出了 SwarmExp,一种基于经验提取和经验回放的简单而有效的方法,它持续提高了 大语言模型 的编排性能。