论文

通过 logits 偏差进行单查询黑盒校准审核

Single-Query Black-Box Calibration Auditing via Logit Bias

模型评测评测方法与指标

摘要

评估 大语言模型 (LLM) 的校准对于其作为零样本分类器的安全部署至关重要。然而,商业 API 提供商越来越多地隐藏标准校准指标所需的连续输出概率。为了绕过这种不透明性,我们证明任何公开 logits\_bias 参数的 LLM API 都可以通过数学操作来严格使用每个样本的一个查询来评估精确的概率阈值。利用这种机制,我们为二进制任务引入了一种新颖且可证明一致的真实校准误差估计器。因此,我们的方法为审计黑盒基础模型提供了一个有效的框架。