论文
M3MAD-Bench:跨领域和模式的多智能体辩论真的有效吗?
M3MAD-Bench: Are Multi-Agent Debates Really Effective Across Domains and Modalities?
摘要
作为一种智能体级推理和协调范式,多智能体辩论(MAD)通过结构化辩论来协调多个智能体,以提高答案质量并支持复杂推理。然而,现有的 MAD 研究存在两个根本局限性:评估是在分散且不一致的环境下进行的,阻碍了公平比较,并且很大程度上仅限于仅依赖文本输入的单一模态场景。为了解决这些差距,我们引入了 M3MAD-Bench,这是一个统一且可扩展的基准,用于跨多域任务、多模态输入和多维指标评估 MAD 方法。 M3MAD-Bench 建立了五个核心任务领域的标准化协议:知识、数学、医学、自然科学和复杂推理,并系统地涵盖纯文本和视觉语言数据集,从而实现受控的跨模态比较。我们在跨越不同架构、规模和模态功能的九个基本模型上评估 MAD 方法。除了准确性之外,M3MAD-Bench 还结合了以效率为导向的指标,例如token消耗和推理时间,提供了性能与成本权衡的整体视图。广泛的实验对 MAD 在纯文本和多模态场景中的有效性、鲁棒性和效率产生了系统的见解。我们相信 M3MAD-Bench 为未来标准化 MAD 评估研究提供了可靠的基础。代码可在 http://github.com/liaolea/M3MAD-Bench 获取。
