论文
MASEval:将多智能体评测从模型扩展到系统
MASEval: Extending Multi-Agent Evaluation from Models to Systems
摘要
基于LLM的智能体系统被快速采用,催生了丰富的框架生态(smolagents、LangGraph、AutoGen、CAMEL、LlamaIndex等)。然而现有基准以模型为中心:它们固定智能体设置,不比较其他系统组件。我们认为,实现决策对性能有重大影响,包括拓扑、编排逻辑与错误处理等选择。MASEval用一个与框架无关、将整个系统作为分析单元的库来填补这一评测空白。通过在3个基准、3个模型与3个框架之间进行系统的系统级比较,我们发现框架选择与模型选择同样重要。MASEval让研究者能够探索智能体系统的所有组件,为有原则的系统设计开辟新途径,也让从业者能够为其使用场景找到最佳实现。MASEval以MIT许可发布于 https://github.com/parameterlab/MASEval。