论文

RUMAD:强化学习统一的多智能体辩论

RUMAD: Reinforcement-Unifying Multi-Agent Debate

智能体系统模型训练强化学习Agent 协作Agentic RL

摘要

多智能体辩论(MAD)系统利用集体智慧增强推理能力,但现有方法难以同时优化准确率、共识形成与计算效率。静态拓扑方法缺乏对任务复杂度变化的适应性,而基于外部LLM的协调则可能引入损害辩论中立性的特权知识。本工作提出RUMAD(Reinforcement-Unifying Multi-Agent Debate),一个把MAD中的动态通信拓扑控制形式化为强化学习(RL)问题的新框架。RUMAD采用内容无关的观察方案,捕捉高层辩论动态,避免访问智能体的原始推理内容。RUMAD使用多目标奖励来建模解答质量、凝聚性与效率。一个经PPO训练的控制器动态调整通信图中的边权重,同时双阈值机制实现对智能体激活与信息可见性的细粒度控制。在MMLU、GSM8K和GPQA基准上的实验评估表明,RUMAD取得可观的效率收益,token成本降低超过80%,同时相比单个LLM模型和多个MAD基线提升了推理准确率。值得注意的是,仅在MMLU上训练的RUMAD对域外(OOD)任务表现出稳健的零样本泛化,表明所学通信策略捕捉到了有效多智能体协调中与任务无关的原则。这些结果确立RUMAD作为在现实资源约束下部署多智能体推理应用的高效且稳健的方法。

RUMAD:强化学习统一的多智能体辩论
图2:RUMAD 的流程流水线。在第一阶段,所有智能体给出初始回答。在第二阶段,RUMAD 在阶段 2.1 中组织拓扑结构,被选中的智能体在阶段 2.2 中相互辩论。在最后阶段,通过多数投票获得最终决策。RUMAD 的流程流水线。在第一阶段,所有智能体给出初始回答。在第二阶段,RUMAD 在阶段 2.1 中组织拓扑结构,被选中的智能体在阶段 2.2 中相互辩论。在最后阶段,通过多数投票获得最终决策。