论文
Agent Q-Mix:通过强化学习为 LLM 多智能体系统选择正确的操作
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
摘要
大语言模型(LLM)在完成各项任务方面表现出色。然而,解决复杂问题往往需要多个智能体的协调,这就提出了一个基本问题:如何有效地选择和互连这些智能体。在本文中,我们提出了 \textbf{Agent Q-Mix},这是一种强化学习框架,它将拓扑选择重新表述为协作多智能体强化学习(MARL)问题。我们的方法使用 QMIX 值分解来学习去中心化通信决策,其中每个代理从一组通信动作中进行选择,这些动作共同产生循环通信图。 Agent Q-Mix 的核心是将拓扑感知的 GNN 编码器、GRU 内存和每个代理的 Q-heads 结合在集中式训练与分散式执行 (CTDE) 范式下。该框架优化了平衡任务准确性和词元成本的奖励函数。在编码、推理和数学方面的七个核心基准测试中,与现有方法相比,Agent Q-Mix 实现了最高的平均准确度,同时展示了卓越的词元效率和针对代理故障的鲁棒性。值得注意的是,在使用 Gemini-3.1-Flash-Lite 作为骨干的具有挑战性的 Humanity's Last Exam (HLE) 中,Agent Q-Mix 达到了 20.8\% 的准确率,优于 Microsoft Agent Framework (19.2\%) 和 LangGraph (19.2\%),其次是 OpenClaw 的 AutoGen 和 Lobster。这些结果强调了学习的、分散的拓扑优化在突破多智能体推理界限方面的有效性。