论文

带聚合置信信号的多智能体协议

Multiagent Protocols with Aggregated Confidence Signals

智能体系统Agent 协作

摘要

置信度用于自然语言处理 (NLP) 中的可靠性、监督和一系列下游决策任务,但现有方法还没有产生或评估多智能体系统输出的置信度。之前的工作使用多智能体辩论(MAD)中的置信度来衡量消息、触发辩论或校准单个智能体,但它从未将这些聚合为系统本身的单个置信度。我们引入了三种协议,这些协议首先转换原始置信度信号以使它们在模型之间具有可比性,然后通过软投票或我们称为贝叶斯融合的概率融合将它们组合起来,从而产生最终答案以及单个聚合置信度。这种聚合置信度比最佳单一智能体或标准辩论基线更具辨别力 (AUARC),而正确性 (F1 分数) 保持稳定,并弥补了 MAD 在更模糊的任务中造成的损失。分析两个估计器、序列概率和自报告,以及参数和非参数校准器,我们发现校准提高了两个估计器的 F1,而 AUARC 对其的依赖程度较低。我们评估每个基准的六个同质和异构辩论对,跨越五个基准和四种任务类型,涵盖一系列模型功能和规模。

带聚合置信信号的多智能体协议:论文配图
图 3:BoolQ 和 EZStance 数据集的一致性正确性动态 对于零样本、MAD 和 MAD-D,属于每个一致性正确性类别的样本百分比:均一致且正确、均一致且不正确、一个正确且一个不正确、以及不同意且均不正确。