论文

多Agent辩论中的分歧与答案质量:分层分析

A Layered Analysis of Disagreement And Answer Quality in Multi-Agent LLM Debate

模型评测模型行为与机制分析

摘要

人们普遍认为,多主体辩论是指几个大语言模型在回答之前交换论点,通过表达真正的分歧来提高答案质量。这种机制很少受到检查。我们引入四种衡量标准:(A) 辩手报告的一致程度; (B) 其回复文字是否真正推回; (C) 一旦引发指令被移除,仓位是否仍然存在; (D) 对于开放权重模型,辩论者自己的象征对数概率中的立场反应。我们评估了三种模型委员会在 750 场辩论中以三种语气进行开放式 GlobalOpinionQA 辩论:友好(寻求共同点)、中立和敌对(对每个立场进行压力测试)。 (A) 语气强烈重塑了报告的一致性:友好端点和敌对端点之间的完全一致性相差 50.4 个百分点。 (B) 只阅读回复文本而不阅读自我报告或条件的法官会恢复相同的模式。 (C) 异议似乎部分与引发异议的指令有关:删除敌意指令后,标签恢复一致的情况比在保留敌意指令的匹配重新询问下更常见;23.1 分;问题加权推理仅在第一轮回合中没有结论(p=0.0625),在所有回合中显着合并(p=0.016),并且只有 11/28 的第一轮回复也出现在回复文本中。 (D) 反对的论点更能持续地削弱辩手的立场余地,而不是改变其方向。对于最终答案,我们没有检测到质量提高:经过偏见检查的陪审团返回 299/299 平局(仅排除较大差异),可验证控制任务的准确性没有变化,并且未经偏见检查的陪审团在 66% 的情况下宣布辩论获胜——这是阅读顺序的产物。总的来说,大语言模型辩论很容易改变智能体的言论,但我们发现更弱的证据表明它改变了他们坚持认可的内容或提高了最终答案的质量。