论文
衡量错误的事情:内部危害性为反排名成功越狱打分
Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks
摘要
内部安全分数在生成任何文本之前对提示进行判断,并通过区分有害提示和良性提示的程度来验证它们。然后,这种分离被解读为分数也将捕获成功的攻击的证据。恶意意图是提示的一个属性。越狱成功是特定目标模型、解码策略和判断之后产生的结果。如果过滤器调整了测量错误数量的分数,则将其误报预算用于无论如何都会失败的攻击。在本文中,我们审核了该推论。基于注意力的测量通常是从与提示相关的位置读取的,因此包装器会更改正在判断的内容和获取信号的位置。因此,我们引入了主动注意力探测,它提供了一个固定的内容独立测量坐标。我们将每个基本目标与普通版本和包装版本配对,并从目标模型生成真正的完成结果。在 Llama 上,包裹将有害生成从 0.05 提高到 0.27,而有害意图 AUROC 从 0.936 下降到 0.803,因此攻击变得更加危险,而提示看起来更安全。在打包的有害提示中,结果 AUROC 为 0.220,这使得成功的攻击低于失败的攻击。稀有词元、被动和检测器派生通道在相同的匹配设计上重现了逆转,并且逆转本身在三个目标模型、七个攻击系列和两个独立法官中持续存在。然后,分布偏移会降低校准和阈值转移,然后再降低排名。