论文

计算动作,权衡声音:在持续对手下校准多大语言模型理事会的贝叶斯辩证论证

Counting Moves, Weighing Voices: Bayesian Dialectical Argumentation for Calibrated Multi-LLM Councils under Persistent Adversaries

智能体系统Agent 协作

摘要

多 LLM \emph{council} 可以让多个大语言模型 (LLM) 仔细考虑问题并返回答案和置信度估计。随着这些系统越来越多地用于推理,这种置信度应该代表经过校准的 \emph{probability of being correct},并且当某些Agent持续不可靠时,决策应该保持稳健。现有的 \emph{council aggregation} 方法在两个方面都失败了:它们的置信度估计衡量的是决定性而不是正确性,并且它们无法识别或折扣持续不可靠的Agent。我们引入贝叶斯辩证论证 (BDA),它将理事会的 \emph{typed} 行动(谁提出、挑战或承认哪个答案)视为对具有 \emph{per-agent} 可靠性的经典注释器模型的观察。该公式将多智能体审议重新定义为可靠性估计问题,使用审议轨迹来推断持续对抗行为下智能体的可靠性。通过根据推断的Agent可靠性对证据进行加权,BDA 可以生成候选答案的校准后验概率,同时允许持续不可靠的Agent被倒置,而不仅仅是被否决。在二进制和多类基准中,BDA 在零成本委员会聚合方法中实现了最佳校准,不需要额外的 LLM 调用,并提高了持续对抗联盟下的鲁棒性,同时在清洁环境中保持竞争力。