论文
安全原型不是安全方向:响应安全嵌入中的参考依赖和提示混淆
A Safe Prototype Is Not a Safety Direction: Reference Dependence and Prompt Confounds in Response-Safety Embeddings
摘要
响应安全性可以通过与已知安全响应的平均嵌入的余弦相似度来评分吗?最近的睡眠Agent检测器准确地提出了这个分数,但未识别原始正质心规则:正观察相对于编码器原点定位安全类,但无法确定哪个方向将安全响应与不安全响应分开。我们使用四个冻结编码器和提示分组分割来审核两个提示控制的、人工标记的语料库和一个辅助陪审团标记的源代码控制的规则。在人类标记的语料库上,安全原型达到 ROC-AUC 0.457-0.545,其中两个细胞显着低于机会值,一个高于机会值,而在相同嵌入上,明确的安全减去不安全参考达到 0.588-0.738;在陪审团控制下,原型反转 (0.358-0.405),参考值达到 0.754-0.793。在验证校准的 5% 错误安全阈值下,该参考在 PKU-SafeRLHF(编码器之间为 0.153-0.263 与 0.039-0.061)和 Aegis(0.189-0.291 与 0.004-0.045)上接受更安全的响应,但在 BeaverTails 上则不可靠。完全未标记的保留参考可以恢复部分参考排名,当池中只有 5% 不安全时就更少了,而 80-634 个标记的不安全响应则恢复了大部分。仅提示消融表明提示标签组合可能会夸大不受控制的评估。这是关于原始正质心的有界结果,而不是所有一类方法或安全专用防护装置。类别平均值是位置,不一定是安全方向;具有足够不安全质量的声明参考可识别方向。