论文

SAUCE:并行多Agent推理的不确定性估计

Sequential Probabilistic Uncertainty Estimation for Parallel Multi-Agent Reasoning Systems

模型评测智能体系统Agent 协作鲁棒性、公平性与可信度评测

摘要

基于 LLM 的多智能体系统(MAS)因通过多个智能体之间的交互来提高推理能力而受到越来越多的关注。在这项工作中,我们专注于并行多智能体推理系统,其中多个智能体在多轮中解决同一问题,并将其输出聚合成最终答案。尽管推理性能很强,但此类系统的不确定性估计仍未得到充分探索:MAS 的可靠性不仅取决于各个代,还取决于智能体如何在各轮中交互和演化。我们提出了 SAUCE(通过共识进化的顺序Agent不确定性),这是一种轻量级、免训练的不确定性估计器,它将 MAS 不确定性表述为对潜在系统级信念的顺序推理。 SAUCE 通过过滤式更新聚合回合级协议和生成不确定性信号。跨越五个主干网、五个基准和两个 MAS 协议,SAUCE 在一系列广泛的不确定性估计基线上改进了错误分类检测、选择性预测和校准,包括基于标准对数似然的方法和 MAS 特定的估计器。

SAUCE:并行多Agent推理的不确定性估计:论文原图
图 1:概述。 (A) 两个 MAS 轨迹可以达到相同的最终答案,但可靠性差异很大:输出在各轮中收敛的稳定运行(上图)比输出振荡的不稳定运行(下图)更值得信赖。仅考虑最终输出的静态视图无法区分它们,从而激发了交互动力学的不确定性估计。 (B) SAUCE 将多轮交互建模为一系列轮级观察 (Mt,Rt)(M_{t},R_{t}),其中一致性通过生成不确定性进行加权,并对潜在系统级信念执行过滤式更新。由此产生的轨迹总结定义了 SAUCE 不确定性得分 u⁡(𝒙,τ)u({\bm{x}},\tau)(方程 11)。