论文

OpenMAS-GCom。图增强型多智能体系统的诊断基准

OpenMAS-GCom. A Diagnostic Benchmark for Graph-enhanced Multi-Agent Systems

智能体系统Agent任务评测

摘要

图增强型多智能体系统(G-MAS)通过通信图和角色分配来协调大型语言模型智能体,这决定了智能体如何交换信息和划分职责。然而,跨系统的最终分数比较结合了模型、通信模式、角色和计算成本的差异,使得性能差异很难归因于特定的通信结构、角色分配和信息流。为了解决这个评估归因问题,我们引入了 OpenMAS-GCom,这是一个用于诊断这些组件如何通过受控干预影响 G-MAS 性能的基准。我们通过协作单元、通信链路、共享中间信息和执行规则来表示系统。 OpenMAS-GCom 将原始系统与通过更改一个组件而修改的版本进行比较,同时保持任务、模型、提示和预算限制固定。我们重新连接通信边缘,删除专家或批评代理,用不正确的内容替换中间消息,并在执行过程中禁用工作人员。该基准测试在六个领域的 29 个数据集上评估了 17 个单代理、普通多代理和图形增强配置。我们添加了 400 个 G-MAS-Complex 任务,要求代理组合来自多个文档的信息、解决冲突记录并返回带有源标识符的指定值。实验表明,专家删除后的平均损失比批评家删除后的平均损失更大,尽管原始分数相似,但在错误消息和工作人员故障下的性能下降有所不同,并且不同的配置在 G-MAS-Complex 上实现了最高的准确度和每个词元的准确度。