论文

定位和引导超出注意力的拒绝

Locating and Steering Refusal Beyond Attention

模型评测模型行为与机制分析

摘要

拒绝存在于语言模型内部的哪个位置,当架构发生变化时,这个位置会发生变化吗?在 Transformer 中,拒绝由残余流中的单个方向控制,这是安全性和可解释性工具现在依赖的发现。状态空间模型 (SSM) 通过循环更新而不是注意力来路由信息,与 Transformer 不共享词元混合机制。相同的安全表示是否能够在这种转变中幸存下来,还是必须根据架构重新发现?它幸存下来。单个刚性旋转只能重新定向空间,而不能重塑空间,将一个模型的表示空间与另一个模型的表示空间对齐,因此两个模型真正共享表示。在 Transformer 上训练的危害探测器随后会标记 SSM 的有害输入,并且删除对齐的方向会使模型回答它本来会拒绝的攻击,而相同大小的随机方向的作用要小得多。架构特定的不是指导方向,而是必须阅读的方向。每层计算一个新的输出,然后将其添加到残差流中,并且在添加之前,在此输出(写入站点)上可以清晰地读取损害。保持干预强度固定的控制表明,重要的是估计方向的位置,而不是应用方向的位置。通过检测器触发的门应用,该方向降低了我们测试的所有四个架构系列(SSM、Transformer、循环、混合)中的越狱成功率,并且在 SSM 上,它针对攻击者调整了针对防御的提示。该门只匹配一个简单的规则,每当同一个探测器发射时,该规则都会返回固定的拒绝,因此跨架构传输的是方向本身,而不是防御强度。因此,基于拒绝的安全工具通过重新估计该架构写入站点的方向(而不是重建它)来移植到新架构。