论文

用级联线性特征检测与控制谄媚

Detecting and Controlling Sycophancy with Cascading Linear Features

模型评测模型行为与机制分析

摘要

经激活转向方法解释与控制模型行为需要许多清晰展现期望或不期望行为的对比样本对。这些数据对决定可解释性框架能否可靠检测负责某行为的模型特征——进而决定把模型转向或转离该行为的能力。本工作中——我们提出迭代数据生成管线——隔离负责某行为的级联线性特征。具体地——我们展示:超越简单二元样本对——转而隔离特征程度随行为线性缩放的样本——能更好地解缠特征。我们聚焦检测并转向远离谄媚——语言模型优先用户认可的倾向。我们证明经级联样本发现的谄媚特征形成线性可分子空间——并允许选择比基线方法更清晰对应期望行为的模型激活。我们还评估其支持检测、确定性评分与稳健转向的能力——看到它们匹敌或超越LLM裁判与系统提示基线——同时提供更低计算需求与更多可解释性保证。代码与数据:https://cascading-feats.github.io/。

用级联线性特征检测与控制谄媚:论文配图
图 1:我们的方法概述。 (左)对比特征提取比较中性响应和行为表现响应,以根据激活差异计算单个转向向量。 (右)我们的级联线性特征提取迭代地重新生成从中性起点朝向和远离目标行为的响应,测试多个激活方向。识别在再生过程中表现出单调级联效应的特征(绿色轨迹)会产生更稳健的转向向量,而不是仅出现在某些再生级别的特征(蓝色和橙色轨迹)。