论文

系统一决策是否有效?概率相干性研究

Do System One Decisions Add Up? A Study of Probabilistic Coherence

模型评测评测方法与指标

摘要

决策模型可以为每个问题提供总和为 1 的概率,但当同一决策被分解为更小的步骤时,概率又会不一致。我们使用 TREC、CLINC150 和 MASSIVE 中每个系统 2,500 个匹配的示例来研究 Jev 和英语 Laya 检查点中的这种形式的概率一致性。在 72,000 个分类问题中,我们将直接精细标签预测与宽类别概率以及通过这些类别重建的预测进行比较。两个系统都显示出很大的分歧:Jev 的平均类别级别总变异范围为 0.219 到 0.349,Laya 的平均类别级别总变异范围为 0.424 到 0.689,其中零表示完全一致。其后果截然不同。在 CLINC150 上,重建将 Jev 的准确率降低了 22.9 个百分点(配对 95% bootstrap 区间:[-24.9, -20.9]),并将 Laya 的准确率提高了 21.3 个百分点([18.0, 24.5])。相同的方向适用于所有三个数据集,所有六个未调整的精度变化间隔不包括零。准确性的提高也伴随着可信度的降低:在 MASSIVE 上,Laya 获得了 9.2 个准确度点,而其预期校准误差从 0.046 上升到 0.124。错误分析可以识别大类错误和类内混淆。这些发现说明了为什么决策系统需要对应用程序使用的工作流程中的准确性、置信度校准和概率一致性进行联合评估。