论文
ProbGuard:根据 LLM 输出分布进行校准的安全风险估计
ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions
摘要
最近对 大语言模型 (LLM) 安全性的研究广泛采用护栏来识别不安全的 LLM 输出。现有的护栏通常将安全评估制定为确定性分类任务,将离散词元序列映射到离散安全标签。然而,这种范式有两个局限性:首先,安全评估本质上是一个不确定的问题,特别是在早期状态下。其次,仅依赖离散标记序列会丢弃 LLM 输出分布中嵌入的丰富概率信息。为了解决这些限制,我们提出了第一个完全与概率架构无关的护栏 \textsc{ProbGuard},以利用 LLM 早期输出分布信号来估计和校准安全概率,从而能够及早停止不安全的持续输出。具体来说,给定 LLM 生成的前缀分布,我们将安全风险表示为其持续生成动态的不安全概率,并通过蒙特卡罗采样估计该风险。通过对分布信号和校准安全风险的 后训练,\textsc{ProbGuard} 在所有九个模型-数据集组合设置中实现了最佳校准性能,与最佳基线相比,平均 Brier 分数和 ECE 分别降低了 79.6\% 和 71.9\%。在仅观察前十个解码步骤的 LLM 早期输出分布后,\textsc{ProbGuard} 进一步将六次代表性越狱攻击的攻击成功率限制为最多 1%。