论文
自信的说谎者:用对数概率和 LLM 作为法官诊断多主体辩论
The Confident Liar: Diagnosing Multi-Agent Debate with Log-Probabilities and LLM-as-Judge
摘要
多智能体辩论系统通常仅根据最终答案是否正确进行评估,而忽略了辩论旨在产生的中间推理的质量。本文研究了多智能体辩论中三个信号之间的关系:推理标记上的 词元级 对数概率分布、分配给这些标记的 LLM 作为法官评分以及最终任务准确性。我们检查内部置信信号是否可以预测外部评估的推理质量,以及信号是否与任务正确性相一致,涵盖三个领域:基于标题的评分、数学推理和事实问答。我们的框架将两个智能体辩论架构(构造器和审计器)与作为法官的 LLM 配对,该法官根据指令遵循、论证质量和证据基础以及严重失败标志对每个智能体的推理进行评分。评分标准域中的实验揭示了一致的四阶段置信轨迹和显着的角色不对称性:构建者的置信度与判断推理质量的一致性大约是审核者的两倍,并且基于置信度的关键推理失败检测对于构建者(AUROC 0.804)明显比审核者(0.634)更可靠。这些发现激发了本文提出的更广泛的跨领域调查。