风格胜过内容:不改变内容的包装也会翻转安全裁判判决
Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts
摘要
自动安全法官——诸如 Llama Guard 或 GPT-4o 评分提示之类的系统,可以决定模型的回答是否有害——生成几乎所有报告的越狱成功率、防御评估和安全排行榜背后的数字。我们询问这些评委是否对回复的内容或听起来如何进行评分。我们保持回复的内容固定,并添加内容不变的风格包装:在回复之前或之后放置固定字符串,仅改变其语气(教育免责声明,虚假的安全“推理”块,Token拒绝,然后是未更改的有害主体),或者,在无害的拒绝上,只是听起来很危险的框架。主体是逐字节保存的,因此忠实的法官必须返回相同的判决,任何翻转都是法官的错误,而不是安全性的变化。超过 600 个 JailbreakBench 回复 x 多达 7 份表格 x 8 位评委,我们通过配对显着性检验和测量的本底噪声来测量翻转率。研究结果是精确的,而不是普遍的:大多数法官几乎不移动,但特定的法官隐藏着可廉价利用的盲点。Token拒绝包装器翻转了 19.9% 的 GPT-4o-mini 正确的“不安全”判决(本底噪声 0.5%;在三人多数重新评分下为 18.2%),但仅移动了 Claude 0.4%。部署的 Llama Guard 4 是一种确定性游戏:“教育课程”框架将 12.3% 的有害判断翻转为安全。第二个部署的防护(gpt-oss-safeguard-20b)是免疫的,并且仅重写评分提示(StrongREJECT-style)可以将相同模型上的攻击减少十倍——漏洞存在于判断中,而不是内容中。两个注释者的人工验证确认了 100% 的内容不变性和 90% 的翻转作为判断错误(kappa 0.95-1.0),并且引导程序显示底层模型排名对于单独采样来说已经不稳定。我们发布数据集、包装器、代码和每个判决标签。