论文

改进黑盒 大语言模型 的置信度估计

Improved Confidence Estimates for Black-Box Large Language Models

模型评测评测方法与指标

摘要

不确定性量化(UQ)对于大语言模型(LLM)的安全部署至关重要。现有的方法,从口头表达的置信度到需要多代的方法,通常都是零样本,并且无需标记数据即可产生量化不确定性的分数。尽管如此,实际上,在部署之前,人们必须始终评估其在感兴趣的数据集上的性能。在这项工作中,我们表明,通过利用该数据集,我们始终优于这些现有分数。具体来说,我们构建简单的分类器,通过使用这些分数和类似查询的正确性作为特征来预测 LLM 响应的正确性。我们的方法产生最小的计算开销,使其成为 LLM 中 UQ 对于实际应用的廉价且直接的增强。