您的越狱法官有多可靠?自动 ASR 评分的校准和对抗鲁棒性
How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
摘要
几乎每一篇关于 LLM 越狱和提示注入的论文都报告了攻击成功率(ASR),并且该数字不是由人分配而是由自动判断器分配:要么是针对该任务训练的安全分类器,要么是提示评分的通用聊天模型。法官很少受到检查。我们检查一下。使用 HarmBench 分类器验证集中的 596 个人类标记的完成结果,我们将两个法官家族与人类多数投票进行比较,然后攻击它们。这两个家庭以相反的方式失败。专用分类器超标(精度0.835,召回率0.974);三个不同的 LLM 作为评委保持高精度(0.81 到 0.94),但召回率不稳定(0.06 到 0.65),因此相同的响应会产生非常不同的 ASR,具体取决于哪个评委对它们进行评分。这两个系列在稳健性方面也存在很大差异。不触及有害文本并仅添加良性框架的包装器在 57% 到 100% 的时间内翻转每个 LLM 判断,并且单个前置拒绝语句占其中大部分(39% 到 88%)。专用分类器可以抵抗这些表面攻击(最多 6.7%),但对其开放权重的白盒 GCG 攻击会翻转 70% 的置信真阳性(30 个中的 21 个;95% CI 54 到 86%),即使优化预算很小。两名注释者的审核确认这些攻击并未造成损害:80 个采样翻转中的每一个仍然包含有害内容。由于报告的 ASR 中很大一部分来自 LLM 法官,而且这一比例还在不断增长,因此许多此类数字无论是平均水平还是在故意压力下都是不可靠的。我们建议论文报告对人工标记切片的判断精确度和召回率,报告针对判断精确度进行校正的 ASR,并包括对判断的对抗性检查。我们的代码已经发布了。