论文

在相同的推理成本下,多代理结构无法击败单个冻结代理

At Equal Inference Cost, Multi-Agent Structure Does Not Beat a Single Frozen Agent

智能体系统Agent任务评测

摘要

多代理 LLM 管道(例如 Planner-Executor-Critic 团队)通常会报告相对于单个代理的收益,但这些收益通常会带来更高的推理成本,因为团队在每个环境步骤中进行多个模型调用。现有的自动化方法会搜索角色、拓扑和提示,但通常会在相同的环境中将团队与单个代理进行比较,从而为团队提供额外的计算能力。相反,我们固定了语言模型调用的总数,并询问在相同预算下发展多智能体团队是否仍然优于发展单个智能体。我们引入了 MA-Evolve,它将 Planner-Executor-Critic 团队表示为三个可进化的角色提示,并通过共享冻结 7B 主干上的每个角色坐标上升来优化它们。在 ALFWorld 上,进化单个执行器显着优于未进化的代理,而整个团队实现了最高平均值,但在统计上并不比单个代理更好:0.769 与 0.754,p = 0.80,尽管使用了 1.8 倍的评估调用。留一分析表明,实现的价值完全来自于执行者;计划者和批评者演变为空洞或低影响力的提示,并且很少改变执行者的行动。通过 2-3 次免费计算,团队仅匹配单个代理,并且在 WebShop 上,进化为零,而团队趋势更糟。在相同的推理成本下,多智能体结构增加了成本,但没有明显的好处。