置信路由实际上在做什么:多代理审议中的审计路由、校准和承诺
What Confidence Routing Is Actually Doing: Auditing Routing, Calibration, and Commitment in Multi-Agent Deliberation
摘要
常见的多智能体设计要求智能体报告置信度,并让得分最高的智能体接下来发言,隐式使用一个标量来路由对话并估计不确定性。我们通过分离三个跟踪级问题来审核这个置信路由广播协议:它是否选择了正确的候选者(路由),报告的置信度是否表现得像概率(校准),以及所选代理是否公开声明赢得回合的答案(承诺)。我们的主要研究涵盖 4,181 个 gpt-oss-120b 奥林匹克数学轨迹;我们在 2×2 参与者基准网格上重复审核,该网格添加了 gemma-4-31B-it 和生物学多项选择基准。在主单元格中,置信度可区分正确候选者和错误候选者 (AUROC 0.72),但严重过度自信(平均置信度为 79%,准确度为 52%)。交叉拟合、分层等渗程序将保留候选者的预期校准误差从 0.278 减少到 0.008,但它无法恢复丢失的辨别力:两个 Gemma 单元中的原始 AUROC 仅是 0.537 和 0.440。路由同样依赖于设置。固定路由器在 gpt-oss/math 上最多相差 1.1 个百分点,而原始置信度 argmax 的性能比 Gemma 单元中的随机有效选择低 5.6 和 11.2 个百分点。承诺再次明显:在主单元中,民意调查和口头答案在 20.4% 的有效对中出现分歧,其中 62.4% 的修订是新生代,无条件正确性偏移为 -1.7 点;其他三个单元格的范围是 +0.9 到 +12.2 点。可转移的教训是程序性的:在将原始信心用于部署决策之前,必须单独衡量路由歧视、概率校准和公共承诺。