论文
从特质向量到回路:通过语言模型追踪拒绝和阿谀奉承
From Trait Vectors to Circuits: Tracing Refusal and Sycophancy Through Language Models
摘要
激活空间中在转向时改变安全相关行为的方向不一定是模型用来自行产生该行为的方向。因此,我们询问转向是通过未修改模型的计算还是通过一组不同的组件来起作用,研究了在先前的工作中已提取和验证其方向的两个特征:Qwen2.5-7B-Instruct 中的拒绝和阿谀奉承。对于每个,我们使用特征向量将计算分为向量之前的重建电路和之后的传输电路。然后我们测试恢复坐标是否会返回通过消融删除的行为。对于拒绝,两个电路都是紧凑且忠实的,仅恢复坐标就可以恢复几乎所有因烧蚀而丢失的拒绝信号,并且围绕矢量构建的电路在大约一半的边缘处与直接输入到输出电路的忠实度相匹配。对于阿谀奉承来说,传播是紧凑的,但重建是更广泛的,而且只是部分忠实。因此,传输转向干预的电路不会自动成为产生行为的电路,我们相应地报告每个电路的反事实、目标和行为测试。