论文
充当魔鬼代言人:现成人格向量在谄媚问题上媲美定向引导
Playing Devil's Advocate: Off-the-Shelf Persona Vectors Rival Targeted Steering for Sycophancy
摘要
我们研究不同人格对谄媚的影响,谄媚指即使用户有误,模型也附和用户。标准缓解方法对比激活添加(CAA)从带标注的谄媚与诚实回复配对中推导引导方向。本研究评估现成人格引导向量——最初为通用角色扮演开发、未在谄媚数据上训练——能否作为替代方案。在两个指令微调模型上,朝怀疑或审视型人格引导可将谄媚降至 CAA 效果的约 $68\%$ 与 $98\%$,且与 CAA 不同的是,在用户正确时仍能保持准确率。这一效应还是非对称的:朝迎合型人格引导并不会带来谄媚的镜像式增加。从几何上看,人格向量在激活空间中与谄媚方向基本独立。综合来看,这些发现表明谄媚更适合被理解为人格层面的属性,而非单一可引导方向。我们在此发布代码:https://anonymous.4open.science/r/Sycophancy-Steering-9DF0/。
