论文

更糟糕的是:多用户多Agent团队的性能如何下降

Worse Together: How Performance Breaks Down in Multi-User Multi-Agent Teams

智能体系统Agent任务评测

摘要

人们越来越多地将任务委派给人工智能Agent,而这些Agent越来越多地通过共享资源(例如代码库、日历或预算)遇到其他人的Agent。当每个Agent为具有不同目标的不同用户服务时,协调通常会失败,并且该组最终的情况比单个Agent为每个人Agent的情况更糟糕。我们在四种环境中跨五个前沿模型和 77 个场景研究了这种多用户、多Agent设置:Agent共享计算预算的 API 密钥环境、共享日历的诊所、共享团体订单或预订的个人助理环境,以及共享发布截止时间的合并队列。在每个场景中,我们都会将服务每个用户(协调员)的单个Agent与每个Agent服务一个用户的团队进行比较,Agent之间有或没有通信通道。在每种环境中,团队的团队成果都比协调员差:如果没有渠道,他们就会在两种环境中完全崩溃,即使有一种环境,协调开销也会造成巨大的差距。例如,在个人助理环境中,协调员满足目标用户请求的频率大约是团队的两倍。我们发现了与这种糟糕的团队绩效相关的独特行为,包括随着团队的成长而停滞不前、凌驾于彼此的行为以及捏造声明。我们找到了有效但特定于环境的缓解措施,例如团队领导、明确的程序指令以及使Agent在提交之前读取其对等方消息的平台检查。我们将发布 API 密钥、诊所和个人助理环境作为 MAMUBench,其中包含 74 个用于评估多用户、多Agent协调的场景。