论文
带聚合置信信号的多智能体协议
Multiagent Protocols with Aggregated Confidence Signals
摘要
置信度用于自然语言处理 (NLP) 中的可靠性、监督和一系列下游决策任务,但现有方法还没有产生或评估多智能体系统输出的置信度。之前的工作使用多智能体辩论(MAD)中的置信度来衡量消息、触发辩论或校准单个智能体,但它从未将这些聚合为系统本身的单个置信度。我们引入了三种协议,这些协议首先转换原始置信度信号以使它们在模型之间具有可比性,然后通过软投票或我们称为贝叶斯融合的概率融合将它们组合起来,从而产生最终答案以及单个聚合置信度。这种聚合置信度比最佳单一智能体或标准辩论基线更具辨别力 (AUARC),而正确性 (F1 分数) 保持稳定,并弥补了 MAD 在更模糊的任务中造成的损失。分析两个估计器、序列概率和自报告,以及参数和非参数校准器,我们发现校准提高了两个估计器的 F1,而 AUARC 对其的依赖程度较低。我们评估每个基准的六个同质和异构辩论对,跨越五个基准和四种任务类型,涵盖一系列模型功能和规模。
