论文
当Agent协作时:度量多Agent AI编程中的协调
When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding
摘要
我们研究AI编程Agent团队在解决编程任务时如何协调。当前评估通常只报告Agent是否完成任务以及运行成本,而团队内部的协调在很大程度上未被度量。我们引入一种度量这种协调的仪器。每次运行被表示为一个时序网络,其中Agent和文件是节点,消息、文件写入和文件读取是带成本的时间戳有向边。我们将该仪器应用于1902次运行,每次运行都用固定测试套件评估,涵盖改变团队规模、团队结构和文件策略的多种配置。由此得到的网络展示了协调如何随团队增长和工作变化而变化。直接消息传递最初随Agent数量接近二次增长,其中很大一部分增长来自早期的一轮互相介绍。随着团队进一步扩大,这一增长在我们研究的最大团队中趋于平缓,在这些团队中Agent越来越多地通过广播消息交流。任务也塑造了涌现的网络。围绕共享规范组织的工作产生密集、高度连接的团队,而流水线任务产生围绕局部接口组织的稀疏网络。共享文件可以取代重复的一对一通信,在八Agent的消息密集型工作中将输出token削减约42%,而当文件本已承担协调时则会增加开销。指定某个Agent为协调者不会形成通信枢纽,也不会带来可靠的成功率提升。我们还观察到Agent有一种未被提示的寻找隐藏评分材料的倾向。我们在密封环境中重复关键实验条件,用带标记的占位文件替换隐藏材料。在另外244次运行中,Agent仍在五分之四的运行中伸手去拿这些材料,而协调者和文件通道的结论得到复现。
