论文
CUSP:多智能体多模态推理的可分解集体不确定性
CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning
摘要
聚合异构视觉语言模型 (VLM) 可以改进多模态推理,但单个模型的置信度和聚合答案的置信度都无法衡量系统级别的可靠性。我们提出了 CUSP(通过语义意见池的集体不确定性),这是一种免训练的不确定性量化框架,它将多个 VLM 响应映射到共享语义响应空间,将它们汇集到一个汇集的语义意见中,并报告两个互补的系统级信号:集体不确定性、汇集意见的分散性和 Jensen-Shannon 分歧(JSD),即模型级意见之间的冲突。在这个汇集的语义意见中,非标准化集体熵准确地分解为模型的个体语义熵和 JSD 的平均值,从而将总体分散与模型冲突分开。 CUSP 既不需要Token登录也不需要校准标签,适用于开放重量和商业 VLM。在静态多 VLM 集成中,集体不确定性是小模型体系中最强的信号(预测误差检测为 0.764 AUROC,弃权为 0.889 AUARC),比不确定性基线多数投票和朴素选择高出 4.7 到 15.8 个点,并且随着集成的增长,其裕度不断扩大; JSD 在评估的商业制度中最强(0.819 AUROC、0.910 AUARC),并将与 AUROC 的硬答案模型冲突排名高达 0.982。合并预测的准确度也比平均单一模型提高了 5.6 到 13.0 个点。在多步骤、多智能体系统的完整轨迹上,子智能体集体不确定性将系统故障排列在机会之上 (0.619 AUROC),并在评估的信号中给出最佳弃权排序 (0.699 AUARC)。
