论文
超越红队:LLM 护栏分类器的正式保证
Beyond Red-Teaming: Formal Guarantees of LLM Guardrail Classifiers
摘要
Guardrail 分类器保护生产语言模型免受有害行为的影响,但尽管测试结果看起来很有希望,但它们没有提供正式的保证。为此类模型提供正式保证很困难,因为“有害行为”在离散输入空间中没有自然规范:并且其他领域中使用的标准 epsilon-ball 属性不带有语义含义。我们通过将验证从离散输入空间转移到分类器的预激活空间来缩小这一差距,在该空间中,我们将有害区域定义为包含已知有害提示表示的凸形状。由于 sigmoid 分类头是单调的,因此证明最坏情况点足以证明整个区域,从而在 O(d) 时间内产生闭合形式的健全性证明,而无需近似。为了正式评估这些分类器,我们提出了此类区域的两种构造:SVD 对齐的超矩形,可产生精确的 SAT/UNSAT 证书,以及高斯混合模型,可在语义相干的集群上产生概率证书。将此框架应用于毒性领域的三个经过作者训练的 Guardrail 分类器,每个超矩形配置都会返回 SAT,尽管表面上的经验指标很高,但暴露了所有分类器中可验证的安全漏洞。概率 GMM 证书还揭示了这些模型如何表示危害的不同结构稳定性。虽然 GPT-2 和 Llama-3.1-8B 在不同的边界上保持了 90% 和 80% 的稳健覆盖率,但事实证明 BERT 的安全保证特别不稳定。这种在最佳阈值下“覆盖率崩溃”到 55% 的现象揭示了 BERT 中的安全边际稀疏,只有采用极其保守的悲观阈值才能实现完全覆盖。这些方法相结合,提供了关于护栏分类器的真正有效性的新见解,超越了传统的红队。