论文

超越单圈置信度:LLM 智能体的轨迹自适应不确定性量化

Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents

模型评测智能体系统Agent任务评测鲁棒性、公平性与可信度评测

摘要

语言模型的不确定性量化(UQ)方法通常在单轮输出上进行评估,其中不确定性附加到一个生成的答案上。然而,对于 LLM 代理来说,观察单元是交互式轨迹,其中模型可以提出澄清问题、调用工具、更新状态并做出中间决策,这些决策的错误会传播到最终结果。我们研究了三个常见的单圈 UQ 方法是否可以迁移到这种设置。在来自 BFCL-v4 和 $τ^2$-bench 的五个 LLM 和四个多回合工具使用数据集中,我们评估基于动作标记概率的白盒评分器、基于重采样轨迹的黑盒一致性评分器以及基于轨迹模型自我评估的反射评分器。我们发现转移通常是有用的,但并不均衡。词元概率分数对跨回合使用的聚合器的选择高度敏感,反射分数在大多数评估设置中提供最强的低成本基线,黑盒自我一致性通常是最强的 UQ 家族,轨迹等效性和动作集一致性通常在其变体中排名最高。这些结果表明,为单代开发的昆士兰大学方法应该在轨迹级别重新验证,并仔细注意一致性测量、聚合器选择和计算预算。