论文

CoE:面向智能体化多LLM系统不确定性量化的协同熵

CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems

模型评测评测方法与指标

摘要

多LLM系统中的不确定性估计在很大程度上仍以单模型为中心:现有方法量化各模型内部的不确定性,却未能充分捕捉模型之间的语义分歧。为填补这一空白,我们提出协同熵(Collaborative Entropy, CoE),一个用于多LLM协作中语义不确定性的统一信息论度量。CoE定义在共享的语义聚类空间上,结合两个成分:模型内语义熵与各模型相对集成均值的模型间散度。CoE不是加权集成预测器;它是刻画协作置信度与分歧的系统级不确定性度量。我们分析了CoE的若干核心性质,包括非负性、完美语义共识下的零值确定性,以及当各模型退化为delta分布时CoE的行为。这些结果澄清了何时降低各模型自身的不确定性已经足够,以及何时模型间的残余分歧依然存在。我们还提出了一个简单的CoE引导、免训练的事后协调启发式方法,作为该度量的实际应用。在TriviaQA与SQuAD上使用LLaMA-3.1-8B-Instruct、Qwen-2.5-7B-Instruct与Mistral-7B-Instruct的实验表明,CoE提供了比标准熵类与散度类基线更强的不确定性估计,且随着引入更多异构模型,增益变得更大。总体而言,CoE为多LLM协作提供了一个有用的不确定性感知视角。

CoE:面向智能体化多LLM系统不确定性量化的协同熵:论文配图
图 1:所提议的用于代理多 LLM 不确定性量化的协作熵 (CoE) 框架概述。每个LLM都会生成候选响应,这些候选响应在语义上进行聚类以形成概率分布,然后将其聚合以最小化系统级协作熵。