论文
上半场破拒绝:预充越狱机理研究
Breaking Refusal in the First Half: A Mechanistic Study of the Prefill Jailbreak
摘要
对齐的语言模型会拒绝有害的请求,但一行预填充(“当然,这里是”)会消除拒绝。我们询问它在哪里以及如何失败。伤害表示保持不变:在提示攻击转向合规时,线性探针读取的伤害与拒绝的伤害一样高(0.91-0.98),而行为拒绝则下降到偶然。这适用于四个型号和三个系列(1.5-3.8B 和 14B)。因此,拒绝是一种浅层的、响应现场的计算。我们将其定位到早期窗口:剂量匹配的位置控制显示响应的前半部分足以打破拒绝,而后半部分几乎是惰性的。三个因果探测器汇聚在那个窗口上。恢复那里的伤害方向会部分地重新引起拒绝。注入模型自己的垃圾状态可以逆转越狱(74%,坚持不懈)。并且消除早期响应对预填充的注意力,但不会在其他地方消除同等的注意力,选择性地破坏有害的延续。基本模型控制确定了机制:相同的敲除会破坏连续预填充,特别是在非安全调整的基本模型中(有害内容为 64% 至 25%,而匹配控制为 64%,在 7B 中复制)。因此,预填充的抓地力是通用的自回归调节,而不是特定于安全的抑制,并且“拒绝恢复”是依赖于模型的后备。主导机制是被动的。一个小的安全特异性吸引子仍然位于顶部(logits 迹线浓度 0.24 与 0.03),我们对其主动与被动特征进行了调整,但没有完全分开。没有一个单一的方向或组件是干净的处理:决策是可解码的但分布式的,拒绝跟踪伤害而不是可怕的表面。结果是结构性的:读取未触及的提示端表示的监视器不受构造的影响,但只能免受响应站点攻击。机制是分散的;破坏面是局部的。