论文
一致性错觉:多智能体辩论如何隐藏推理偏差
The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment
摘要
用于医学问答的多智能体 LLM 系统通常将共识视为可靠性信号:如果多个智能体就答案达成一致,则认为该答案是值得信赖的。然而,答案层面的共识并不意味着推理层面的一致性。我们引入了 CARA(跨代理推理对齐),这是一系列自动化指标,用于衡量同意答案的代理是否也同意推理。将 CARA 应用于两个医学 QA 基准(MedQA-USMLE 和 MedThink-Bench)的标准辩论系统,我们识别了一致性错觉:一种失败模式,其中辩论减少了代理之间可检测到的矛盾,同时降低了其推理链的语义相似性;Agent似乎同意更多,但推理不太一致。为了改善这种不一致,我们提出了事实依据约束的辩论协议(GDP),这是一种即时干预措施,要求Agent承诺指定的医疗事实并对其他Agent的主张采取明确的立场。 GDP 在两个数据集和两个主干模型上产生了巨大且一致的对齐改进,Cohen 的 d 范围从 +1.43 到 +1.99,而无需添加 LLM 调用或修改系统架构。我们的结果激发了跨智能体推理一致性,以审计安全关键领域的准确性。