论文

面向异构LLM多智能体系统的迭代批评与路由控制器

Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

多智能体大语言模型(LLM)系统通常依赖控制器来协调一组异构模型,但现有控制器通常仅限于一次性路由:它们选择一个模型一次并直接返回其输出。这种仅路由设计没有提供批评中间草案或支持迭代细化的机制。为了解决这个限制,我们提出了一种批评和路由控制器,它将多智能体协调视为一个顺序决策问题。在每一回合,控制器都会评估当前的草稿,决定是否停止或继续,并在需要时选择下一个代理进行进一步细化。我们将此过程表述为具有显式代理利用率约束的有限范围马尔可夫决策过程(MDP),为跨回合的控制器决策设计复合奖励,并在拉格朗日松弛目标下通过策略梯度优化控制器。跨多个异构多智能体系统和七个推理基准的广泛实验表明,我们的方法始终优于最先进的基线,并大大缩小了与最强智能体的差距,同时使用它的总调用量不到 25%。

面向异构LLM多智能体系统的迭代批评与路由控制器:论文配图
图 1:控制器与异构代理池进行多轮交互,评估代理之前的响应并决定是否退出或优化响应。