论文

Pinocchio:黑盒语言模型的快速不确定性估计

Pinocchio: Fast Uncertainty Estimates for Black-Box Language Models

模型推理推理验证与自校正

摘要

在大语言模型(LLM)的高风险决策应用中,从业者不仅需要准确的 LLM,还需要对其预测的不确定性估计。现有的 LLM 不确定性估计方法要么需要访问模型输出的对数概率,要么需要微调权限。然而,许多工业级 LLM 产品使用闭源 API 模型,而许多此类 API 模型(如 GPT)不返回对数概率,也可能不允许微调。我们提出 Pinocchio,一个用于估计黑盒 API 模型响应正确性的外部校准器。它在七个 LLM 的响应上联合训练,对这些模型留出响应的正确性预测达到 0.862 AUROC,并对来自八个机构的十三个未见模型展现出零样本迁移能力。我们的模型只需一次前向传播即可生成不确定性估计,且无需访问目标模型的 logits、权重或内部状态。一个仅 0.8B 的纯文本轻量检查点即可达到与最大模型相当的 AUROC。我们发布代码,只需两行额外代码即可为现有仓库添加不确定性估计。