论文
面向智能体不确定性量化的恰当评分规则
Proper Scoring Rules for Agentic Uncertainty Quantification
摘要
语言模型智能体日益在整个轨迹中发出不确定性信号,但现有的智能体UQ评估常常将排序有用性与概率真实性混为一谈。AUROC、AUPRC、风险-覆盖、Trajectory ECE与标量化轨迹分数评估的是判别力、分箱校准或塌缩摘要,但并未严格引出完整的前缀条件成功概率轨迹 $q_t = P^\pi(Y=1 | H_t)$。基于prequential恰当评分,我们提出轨迹恰当分数(Trajectory Proper Score,TPS),这是一族与预测器无关的严格恰当轨迹级评分规则,适用于任何被校准为最终成功概率的每步不确定性信号。我们证明,在所选评分族与权重方案内,TPS在完整观测下严格引出成功概率过程。我们进一步将该构造扩展到行政删失轨迹:把完整数据分数投影到可观测的停止前缀上,得到精确的 $q_Z$ 加权缩减分数,以及 $q_Z$ 未被估计时的可处理近似。我们进一步证明,常见的轨迹评估器所针对的对象弱于完整的前缀条件概率过程:Trajectory ECE对分辨率盲视,而标量化Trajectory Brier只引出塌缩后的标量,而非完整轨迹。在StrategyQA、Tau2-Bench、HotpotQA与WebShop上的实验表明,这些理论区别在操作层面可见:概率重校准可以大幅改变TPS而排序指标几乎不变,且可处理的删失近似相对仅用完整数据的评估可能改变结论。