论文

多智能体优势的幻觉

The Illusion of Multi-Agent Advantage

智能体系统Agent任务评测

摘要

普遍观点认为多代理系统 (MAS) 优于单代理系统 (SAS),并列举了上下文保护、并行处理和分布式决策等优势。然而,对这一主张的实证支持主要依赖于使用优先考虑孤立推理任务的基准与 SAS 基线进行比较,而这些基准并没有充分评估这些优势。我们专注于自动生成的 MAS,旨在增强手动设计的对应物的通用性,我们对 SAS,特别是具有自我一致性的思想链 (CoT-SC) 进行严格、系统的评估。在具有交互式多步骤工作流程(例如 BrowseComp-Plus)的传统推理数据集和任务中,我们证明自动 MAS 的性能始终低于 CoT-SC,尽管其成本高出 10 倍。为了将这些故障与任务结构固有的限制隔离开来,我们引入了专为 MAS 定制的诊断综合数据集,具有显式任务分解、上下文分离和并行化潜力。我们表明,专家架构的 MAS 在该数据集上的原始性能和成本效率方面始终优于自动生成的架构,这表明现有的评估框架由于未能考虑计算成本增加的边际效用而掩盖了复杂 MAS 的关键架构差距和低效率。至关重要的是,对生成的 MAS 架构的系统解构表明,当前的自动化设计范例会产生架构膨胀,优先考虑表面复杂性,而不会转化为功能实用性,从而暴露出与多代理原则的根本不一致。

多智能体优势的幻觉:论文配图
图 1:多代理优势的错觉。理论承诺专业化(左);现实揭示了冗余和功能崩溃(右)。自动化框架通常会产生约 10×\约 10\倍于 CoT-SC 的成本,而收益却可以忽略不计(第 4 节)。