论文
一人对N个智能体:置信度失准且相关的LLM智能体舰队审计预算分配
One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence
摘要
单个人类审核者必须在每轮 $B \ll N$ 的审计预算下审计 $N$ 个 LLM 智能体,其依据是可能被对抗性失准的自报告置信度以及相互关联的错误。我们将其建模为双层高斯 copula 上的带预算噪声检查,并定位失准阈值 $\delta^*$——超过该阈值后,按置信度排序的审计比随机审计还要糟糕。两个先验预期被逆转:$\delta^*$ 随预算缩小而上升,且跨家族相关性并不低——共同难度主导了谱系差异。五个开放权重 LLM 表现出运营上无用(近乎恒定)的置信度,其点估计位于或超过翻转点,尽管置信区间横跨该点;一个专有模型的置信度则具信息量,并落在阈值之下。我们给出判定空洞监督的定量准则,并在记录轨迹上重放各策略,证实了上述排序。
