论文
LLM 代理的不确定性量化:分类法、评估方案和实证研究
Uncertainty Quantification for LLM Agents: A Taxonomy, an Evaluation Protocol, and an Empirical Study
摘要
大语言模型 (LLM) 不再仅用于单轮对话,而是越来越多地充当规划、调用工具、检索证据、维护记忆和长期交互的代理,通常通过多轮对话与其他代理一起。因此,知道何时信任代理系统是安全部署的先决条件。然而,现有的量化 LLM 不确定性的工作几乎完全是为单轮问答而构建的。本文认为,错误和不确定性源自多轮对话、环境和工具,而不是单轮问答设置。然而,它来得太晚了,并且复合在一个过于粗糙的单一分数中,无法代表不可靠性。我们使用三轴分类法来组织文献:(1) 不确定性是什么,(2) 如何估计不确定性,以及 (3) 代理管道中不确定性出现的位置。我们研究了步级和轨迹级校准,并通过一个简单的反例表明,第一个并不意味着第二个。对四个模型和最多 50 步预算的真实代理轨迹进行的实验表明,可以计算所提出的度量和报告协议(轨迹检查点预期校准误差,TC-ECE),并且步长误差沿着轨迹耦合。我们发现,来自代理自身响应的置信度估计并不总是优于简单的基线。实验还表明,对所有轨迹进行平均可以隐藏后期的过度自信,当跨不同层面分析结果时,这种过度自信就会变得明显。简而言之,本文确定了代理系统管道中的不确定性来自何处,如何教导代理知道自己何时出错,以及为什么一个置信度数字不够。