论文

超越单一方向的拒答:均值差与迭代零空间投影的初步比较

Refusal Beyond a Single Direction: A Preliminary Comparison of Diff-in-Means and INLP

模型评测模型行为与机制分析

摘要

阿迪蒂等人。 (2024)表明,安全微调聊天模型中的拒绝是由残余流中的单个线性方向介导的,可以通过有害和无害激活的均值差异(DiM)来恢复。我们将基于 DiM 的干预措施(激活添加和定向消融)与源自迭代零空间投影(INLP)的两种干预措施(零空间投影和反事实翻转)在五个开放权重聊天模型上进行比较,询问 INLP 是否可以在转向拒绝方面与 DiM 相匹配,以及其更丰富的参数化是否会产生更多可调整的干预措施。 INLP 反事实翻转在拒绝抑制方面与 DiM 定向消融具有竞争力,而零空间投影始终较弱。将 INLP 限制在提取的子空间的主导方向上,可以保留接近基线困惑度时的大部分抑制效果,从而提供可调节的能力。从几何角度来看,这两种 INLP 干预措施落在激活空间的质上不同的区域:零空间投影使有害和无害簇之间的变换激活 \emph{} 崩溃,而反事实翻转将它们移动到相反的簇中,这表明该模型对概念不存在的编码与其相反的不同——这是一个有趣的区别,值得在未来的工作中进一步研究。

超越单一方向的拒答:均值差与迭代零空间投影的初步比较:论文配图
图 1:残余流空间中干预效果的二维 PCA 可视化,在选定的指令后令牌位置处的选定变压器块的输入处计算。第一个轴固定在有害-无害质心方向,因此水平运动对应于沿拒绝轴的运动。红/蓝点:原始有害/无害激活,暗星标记类质心。橙色十字:在拒绝去除干预下改变有害激活。绿色优点:在拒绝注射干预下改变无害的激活。行是模型;专栏是干预措施。每个(模型、干预系列)单元使用自己的坐标系,因此单元之间的绝对距离不可比较;每个单元格内的相对位置是感兴趣的对象。定向消融将这两种类型都折叠到无害的一侧; ActAdd 和反事实翻转产生双向交换;零空间投影将两个类折叠到两个簇之间的区域中。