论文
用级联线性特征检测与控制谄媚
Detecting and Controlling Sycophancy with Cascading Linear Features
摘要
经激活转向方法解释与控制模型行为需要许多清晰展现期望或不期望行为的对比样本对。这些数据对决定可解释性框架能否可靠检测负责某行为的模型特征——进而决定把模型转向或转离该行为的能力。本工作中——我们提出迭代数据生成管线——隔离负责某行为的级联线性特征。具体地——我们展示:超越简单二元样本对——转而隔离特征程度随行为线性缩放的样本——能更好地解缠特征。我们聚焦检测并转向远离谄媚——语言模型优先用户认可的倾向。我们证明经级联样本发现的谄媚特征形成线性可分子空间——并允许选择比基线方法更清晰对应期望行为的模型激活。我们还评估其支持检测、确定性评分与稳健转向的能力——看到它们匹敌或超越LLM裁判与系统提示基线——同时提供更低计算需求与更多可解释性保证。代码与数据:https://cascading-feats.github.io/。
