论文

校准信任,而不是更清晰的预测:不确定性融合的实证检验

Calibrated Trust, Not Sharper Prediction: An Empirical Test of Uncertainty Fusion

模型评测鲁棒性、公平性与可信度评测

摘要

法律人工智能领域的一项反复提出的建议是,通过将不确定性工具(具有信念传播的证据图、顺序贝叶斯赔率更新、登普斯特-谢弗组合和保形预测)融合到一个管道中来改进案件结果预测。我们在来自 LexGLUE 和 FairLex 的 1,000 个真实的欧洲人权法院案件中对此进行了测试,预测法院是否从案件的事实段落中发现了违反《公约》的行为。我们比较了两个前沿 LLM(Claude Opus 4.8 和 GPT-5.5)的三个家族作为事实证据估计器:(A)原始 LLM,(B)通过融合管道路由的 LLM,以及(C)通过同一管道的术语频率基线。在大约 4,750 次测试中,我们发现:(1) 在歧视方面(AUROC 约为 0.83),管道与原始 LLM 或基线相比没有任何改进;直接使用的前沿LLM是最强的单一鉴别器。 (2) 通过在两个模型之间复制的先验失配机制,天真地构建具有贝叶斯赔率和 Dempster-Shafer 融合的 LLM,使校准误差增加一倍以上(ECE 从大约 0.16 到 0.46)。 (3) Dempster-Shafer 融合在长链上是非常不安全的,会以低于概率的准确率自信地做出错误的标签;我们建议将其删除。 (4) 管道的真正价值是可操作的:通过共形选择性预测层,系统决定哪些案例要自动化,哪些案例要升级。在删除 Dempster-Shafer、重新校准并在全部 1,000 个案例集上应用类别条件风险控制后,调整后的引擎以 96.8% 的准确度自动清除,逃逸了 0.5% 的错误,并捕获了 96.3% 的错误进行审查,而未调整的基线的准确度为 85.9/3.8/72.1。这种渠道在法律上的贡献是经过校准的信任,而不是更敏锐的预测。