论文
共识的代价:独立自我修正优于无引导同质多智能体辩论
The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate
摘要
多智能体辩论(LLM 团队迭代地交换理由并对答案进行投票)在同行评审过滤幻觉的假设下被广泛部署。然而,同质辩论的失败动态仍然知之甚少,因此我们报告了对 $N{=}10$ 同质代理团队(Qwen2.5-7B、Llama-3.1-8B、Ministral-3-8B)在两个高难度基准(GSM-Hard 和 MMLU-Hard)的 $R{=}3$ 辩论轮中进行的受控实证研究的结果。我们将同行辩论与孤立的自我纠正和从不相关问题中注入原理的随机噪声控制进行比较。我们将辩论失败分解为三种依赖于模型的途径:阿谀奉承,代理人不加批判地采用多数答案(模式采用率高达 85.5%);情境脆弱性,同伴的推理破坏了之前正确的推理(脆弱性高达 70.0%);共识崩溃,多数投票丢弃生成池中已有的正确答案(预言机差距高达 32.3 个百分点)。对通信密度($K \in \{2,4,9\}$)和采样温度($T \in \{0.4, 0.7\}$)的消融表明,在最小的同行暴露($K{=}2$)下,一致性达到高水平,并随着初始多样性的增加而增强。在所有配置中,在同等或更低的准确度下,辩论比自我纠正多消耗 2.1-3.4$\times$ 词元(每个问题最多 28,631 个词元)。我们的结果表明,在 7-8B 参数类别中,没有结构化角色的同质团队不会从无指导的同行交流中受益,并且孤立的自我纠正始终提供更有利的成本准确性权衡。