论文
并非所有翻转都是一致的:分解多智能体 LLM 辩论中的立场收敛
Not All Flips Are Conformity: Decomposing Stance Convergence in Multi-Agent LLM Debate
摘要
多智能体辩论(MAD)是一种很有前景的改进 LLM 推理的策略,但是当智能体集中在一个共同的答案上时,尚不清楚这种趋同是否反映了真正的深思熟虑或社会服从性。我们表明,传统的答案翻转率合并了三种不同的机制:自发的不稳定、立场引起的一致性和推理引起的说服。我们的三源分解框架通过受控的反事实条件将每个源分解。在主要 MMLU-Pro 设置中,37% 的代理问题观察结果仅在自我反思下发生变化,而稳健性测试显示 GPQA-Diamond 和三个模型系列存在显着的模型依赖性不稳定性;严格一致性在主要设置中为 29%,并且在模型复制中仍然是主要有害的(57-77% 正确到错误)。一项受控信息梯度实验表明,即使是空洞的推理也会导致抵抗代理中 20-39% 的错误采用,而类似推理的演示具有很大的说服力。有害的从众行为可以从第 0 轮特征中预测 (AUC = 0.79),而风险针对性干预将其降低 13.6 个百分点 (p < 0.001)。然而,如果没有正确性标签或自我反思控制,减少同行采用并不能提高准确性,因为无法区分有害和有益的影响。