论文
多代理系统的响应条件并行到顺序编排
Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems
摘要
多智能体系统可以通过多个大语言模型智能体之间的协作来解决复杂的任务。现有的协作框架通常以并行或顺序模式运行。在并行模式下,代理独立响应查询,然后聚合响应。相比之下,顺序系统允许代理通过有向拓扑进行通信并逐步完善彼此。然而,这两种模式都不足以实现最小化通信和延迟同时最大化最终响应的准确性的预期目标。在这项工作中,我们引入了一种名为 Nexa 的混合范例,这是一种可训练的响应条件策略,可以弥补两种模式之间的差距。 Nexa 从并行执行阶段开始,将生成的响应嵌入到共享语义空间中,然后预测稀疏有向非循环通信图。如果图为空,则系统保持纯并行;如果非空,则系统执行一次顺序消息传播。该策略是一个轻量级的 Transformer 模型,该方法避免了对外部 LLM 法官或奖励模型以及手工制作的测试时拓扑搜索的需要。我们形式化了这个混合执行问题,表明生成的图是非循环的,并且该框架严格包含纯并行执行,并提出了基于 同策略 梯度优化的训练过程。结果表明,当智能体、任务或底层智能体的数量发生变化时,Nexa 在一种设置下学习到的响应条件策略可以被重用,从而强调了学习到的通信策略的通用性。