论文
基于 LLM 的分类置信度估计中的评估陷阱和稀疏性限制
Evaluation Pitfalls and Sparsity Limitations in LLM-based Confidence Estimates for Classification
摘要
当使用 LLM 进行分类时,置信度估计至关重要,表明预测何时可信。然而,诸如言语化之类的常见方法会产生极其稀疏的输出。例如,Qwen3-32B 在 SST-2 上仅表达了八个独特的置信度值,其中一半以上正好是 95%,我们在四个数据集和两个 LLM 中一致观察到这种模式。除了限制实际效用之外,我们还表明这种稀疏性严重影响评估:精度拒绝曲线(AUARC)下面积插值的选择极大地改变了排名,在逐步插值与线性插值下,一致性采样从最佳下降到最差。我们主张标准化逐步插值以进行更公平的比较。在这样的公平评估下,我们发现通过标记概率对语言化数字进行加权(一种我们称为语言化对数概率的方法)可以解决稀疏性并实现最佳 AUARC(比普通语言化+2.3 分),而不会产生额外的推理成本。