论文
理解多智能体LLM框架:统一基准与实验分析
Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis
摘要
多智能体LLM框架被广泛用于加速基于大语言模型(LLM)的智能体系统开发。这些框架施加不同的架构结构,约束智能体如何交互、存储信息与协调任务。然而,它们对系统性能的影响仍知之甚少。这一空白至关重要,因为仅架构选择本身即可带来数量级的延迟与吞吐差异,以及准确率与可扩展性的显著变化。应对这一挑战需要(i)联合评估多种能力,如编排开销、内存行为、规划、专门化与协调;(ii)在受控的框架级条件下开展评估,以隔离架构效应。现有基准聚焦单项能力,缺乏标准化的框架级评估。我们通过以下方式解决这些局限:(i)引入一个架构分类法,沿基本维度系统比较多智能体LLM框架;(ii)开发MAFBench,一个在标准化执行流水线下整合现有基准的统一评估套件。利用MAFBench,我们在多个广泛使用的框架上开展受控实证研究。结果表明,仅框架级设计选择即可使延迟增加超过100倍,规划准确率最多下降30%,协调成功率从高于90%降至低于30%。最后,我们将发现转化为具体的架构设计原则与框架选型指导,并勾勒有前景的未来研究方向。
