论文
CollabFlow:Agent协作的递归自我改进
CollabFlow: Recursive Self-Improvement of Agent Collaboration
摘要
递归自我改进(RSI)让系统根据其自身的结果进行改进;在基于 LLM 的多智能体系统中,智能体在一项任务中相互完善,结果改善了他们跨任务协作的方式。然而,现有的多智能体协作使这个循环保持开放:协作是在操作员级别预先定义的,仅拓扑学习保持逐字交换,从而传播错误,并且系统自身结果的奖励最大化集中在少数团队身上。为了应对这些挑战,我们提出了 CollabFlow,一种学习智能体协作的 RSI 系统:可训练的协作主管构建完整的智能体团队,冻结的执行器运行它们,每轮的结果重新训练主管。在每一轮中,协作图的边缘都承载有证据条件的通信协议:只有当发送者的证据比发送者的证据强得多时,接收者才会采用不同的答案,因此导演知道谁进行通信以及如何通信。在各轮中,我们进一步提出了协作轨迹平衡(CTB),这是一个基于流程的目标,它在每个团队完成其施工订单后将其记入一次,并以按比例分配奖励为目标,以便几个优秀的团队留在比赛中。我们还限制了这个自行生成的目标在轮次之间移动的距离,随着记录的积累而缩小。在 12 个数据集上,CollabFlow 优于所有基线,并且在各轮中不断改进。代码可在 https://anonymous.4open.science/r/CollabFlow-631E. 获取