论文
LLM智能体团队中互换性的测试
Testing Interchangeability in LLM Agent Teams
摘要
生产多智能体系统会不断更换智能体,假设担任某个角色的智能体可以与任何其他可以完成该工作的智能体互换。我们测试这个假设。每个场景有八个团队独立于一个基本模型组成,执行相同的任务,每个特工在十个编组情节中保留一个私人笔记本;然后,我们在团队之间交换角色匹配的智能体,并衡量保留任务的变化。与安慰剂相比,在不改变占据席位的情况下重现名单变化的干扰,交换在任务分数上花费很少,但将团队每单位进度所花费的沟通成本提高了 16% 至 63%,并且在 Hanabi 中,交换的特工比没有经验的特工更昂贵,这与从前合作伙伴那里学到的惯例的干扰一致。在“Collab-Overcooked”中,当制定议程的智能体被替换时,大部分额外的沟通来自留下来的智能体。基本模型、解码温度和编队长度等三项消融,将交换惩罚与另一个量一起移动:独立组建的团队相距多远。贪婪解码会降低两者;将一支球队的历史加倍可以提高两者。在这些设置中,智能体在任务结果方面比在协调效率方面更具可替代性,在较长的形成历史后具有更大的交换效应。