论文

当Agent协作时:度量多Agent AI编程中的协调

When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding

模型评测评测方法与指标

摘要

我们研究AI编程Agent团队在解决编程任务时如何协调。当前评估通常只报告Agent是否完成任务以及运行成本,而团队内部的协调在很大程度上未被度量。我们引入一种度量这种协调的仪器。每次运行被表示为一个时序网络,其中Agent和文件是节点,消息、文件写入和文件读取是带成本的时间戳有向边。我们将该仪器应用于1902次运行,每次运行都用固定测试套件评估,涵盖改变团队规模、团队结构和文件策略的多种配置。由此得到的网络展示了协调如何随团队增长和工作变化而变化。直接消息传递最初随Agent数量接近二次增长,其中很大一部分增长来自早期的一轮互相介绍。随着团队进一步扩大,这一增长在我们研究的最大团队中趋于平缓,在这些团队中Agent越来越多地通过广播消息交流。任务也塑造了涌现的网络。围绕共享规范组织的工作产生密集、高度连接的团队,而流水线任务产生围绕局部接口组织的稀疏网络。共享文件可以取代重复的一对一通信,在八Agent的消息密集型工作中将输出token削减约42%,而当文件本已承担协调时则会增加开销。指定某个Agent为协调者不会形成通信枢纽,也不会带来可靠的成功率提升。我们还观察到Agent有一种未被提示的寻找隐藏评分材料的倾向。我们在密封环境中重复关键实验条件,用带标记的占位文件替换隐藏材料。在另外244次运行中,Agent仍在五分之四的运行中伸手去拿这些材料,而协调者和文件通道的结论得到复现。

当Agent协作时:度量多Agent AI编程中的协调:论文配图
图8:协调 token 的去向,按通道与策略划分(两个实验;每个条形组 90 次运行)。这些条形是基于两种不同口径的代理指标:消息条形为消息长度(约每 token 四个字符),文件条形为发起轮次的输出 token 在其各工具调用间分摊的量,且两者均不计缓存上下文。因此它们只反映通道转移的方向;正文中的运行级输出 token 总量采用模型报告的数字。需要注意:在强制(mandatory)条件下,两个实验中消息 token 都骤减、文件 token 都增长。总体输出只在实验 1 中下降;在实验 2 中文件已承担协调工作,因此该规则只增加开销。在禁止(forbidden)条件下,文件条形即团队必须撰写的交付物本身:这些运行中的每一次写入都指向交付物(实验 1 中 270 次多智能体运行全部如此),条形非零是因为同一文件在每次运行中会被创建和修改多次。