论文

大语言模型 中的不确定性弃权,具有可证明的对齐保证

Uncertainty-Aware Abstention in Large Language Models with Provable Alignment Guarantees

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地部署在问答 (QA) 系统中,但在没有可靠的置信度估计的情况下,它们可能会生成幻觉或错位的响应。不确定性量化(UQ)为选择性回答提供了自然的基础,系统仅在其预测被认为可靠时才回答,否则放弃。然而,LLM 现有的不确定性分数通常是启发式的:根据此类分数选择的阈值本身并不能为接受的答案中的错误率提供统计保证。我们提出了 CIC,一种基于置信区间的校准框架,可将任意不确定性分数转换为风险控制的选择性回答规则。给定一个保留的校准集,CIC 使用特定于应用程序的对齐标准评估每个生成的响应,并将其与不确定性分数和二进制错误标签相关联。对于每个候选不确定性阈值,CIC 估计接受条件错误率,并使用 Hoeffding 式或 Clopper-Pearson 置信区间构建高概率置信上限。然后,它选择上限低于用户指定的风险水平 $α$ 的最大阈值,从而在有限样本可靠性约束下最大化回答率。在可交换性下,CIC 以至少 $1-δ$ 的概率保证所选阈值(如果非空)将接受的答案中的错误率控制在 $α$ 级别。我们在七个 LLM 和多个不确定性估计器的封闭式和开放式 QA 基准上评估 CIC。实验结果表明,CIC 始终如一地实现了有效的风险控制,同时保持了强大的应答效率,为在可靠性敏感的 QA 工作流程中部署 LLM 提供了实用且有统计依据的机制。