论文
RUMAD:强化学习统一的多智能体辩论
RUMAD: Reinforcement-Unifying Multi-Agent Debate
摘要
多智能体辩论(MAD)系统利用集体智慧增强推理能力,但现有方法难以同时优化准确率、共识形成与计算效率。静态拓扑方法缺乏对任务复杂度变化的适应性,而基于外部LLM的协调则可能引入损害辩论中立性的特权知识。本工作提出RUMAD(Reinforcement-Unifying Multi-Agent Debate),一个把MAD中的动态通信拓扑控制形式化为强化学习(RL)问题的新框架。RUMAD采用内容无关的观察方案,捕捉高层辩论动态,避免访问智能体的原始推理内容。RUMAD使用多目标奖励来建模解答质量、凝聚性与效率。一个经PPO训练的控制器动态调整通信图中的边权重,同时双阈值机制实现对智能体激活与信息可见性的细粒度控制。在MMLU、GSM8K和GPQA基准上的实验评估表明,RUMAD取得可观的效率收益,token成本降低超过80%,同时相比单个LLM模型和多个MAD基线提升了推理准确率。值得注意的是,仅在MMLU上训练的RUMAD对域外(OOD)任务表现出稳健的零样本泛化,表明所学通信策略捕捉到了有效多智能体协调中与任务无关的原则。这些结果确立RUMAD作为在现实资源约束下部署多智能体推理应用的高效且稳健的方法。
