论文

BAS:评估 大语言模型 置信度的决策理论方法

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在弃权更安全的情况下经常会产生自信但不正确的答案。然而,标准评估协议需要回应,并且没有考虑信心应如何指导不同风险偏好下的决策。为了解决这一差距,我们引入了行为一致性评分(BAS),这是一种决策理论指标,用于评估 LLM 信心对弃权意识决策的支持程度。 BAS 源自明确的“回答或弃权”效用模型,并聚合了一系列风险阈值内已实现的效用,从而产生了决策级别可靠性的衡量标准,该衡量标准取决于置信度的大小和顺序。我们从理论上证明,真实的置信度估计可以独特地最大化预期的 BAS 效用,将校准与决策最优行为联系起来。 BAS 与正确的评分规则(例如对数损失)相关,但在结构上有所不同:对数损失对称地惩罚信心不足和过度自信,而 BAS 施加不对称惩罚,强烈优先考虑避免过度自信的错误。然后,我们使用 BAS 以及 ECE 和 AURC 等广泛使用的指标,构建跨多个 LLM 和任务的自我报告置信可靠性基准。我们的结果揭示了决策有用置信度的巨大差异,虽然更大、更准确的模型往往会实现更高的 BAS,但即使是前沿模型仍然容易出现严重的过度自信。重要的是,由于高度过度自信的错误,具有类似 ECE 或 AURC 的模型可能会表现出截然不同的 BAS,这凸显了标准指标的局限性。我们进一步表明,简单的干预措施,例如 top-k$ 置信度启发和事后校准,可以有意义地提高置信度可靠性。总体而言,我们的工作为评估 LLM 置信可靠性提供了原则性指标和综合基准。