论文
不要仅通过激活来判断LLM:通过反事实激活潜力发现被抑制的安全功能
Don't Judge an LLM Only by Its Activations: Discovering Suppressed Safety Features via Counterfactual Activation Potential
摘要
机械解释性已成为理解LLM安全行为的主要手段。然而,现有的工具主要关注激活神经元或模型的特征。对于此类方法来说,剩余的大量非活动组件的作用是不可见的。这项工作表明,非活动集包含与拒绝有害提示有因果关系的安全关键特征。抑制此类功能可能会将拒绝转变为遵从,同时不会被流行的可解释性工具检测到。我们引入了反事实激活电位(CAP),该指标将被抑制特征的潜在激活趋势量化为编码器对齐(输入驱动它的强度)、抑制强度(活动特征抑制它的强度)和安全关键性(拒绝的程度取决于它)的乘积。为了大规模地找到被抑制的安全特征,我们提出了 CAP 引导的安全特征发现(CSFD),这是一种两阶段过滤算法,可以从数十万个转码器特征中识别候选安全特征,而无需详尽的消融。当候选功能被取消时,很大一部分试验会遵循有害的提示。在自然越狱的情况下,对最高 CAP 功能的抑制会上升 2-4 倍,而它们的激活也会相应下降高达 80%。放大功能的抑制器会降低其激活并提高与被抑制功能相关的提示的有害遵从性,但对于随机功能则没有这种效果。我们的实验涉及不同参数尺寸的五种 Gemma、Qwen 和 Llama 模型。我们的研究结果表明,越狱可以部分通过抑制安全关键功能而不是仅仅激活有害功能来进行,并且抑制功能是对以激活为中心的安全行为可解释性的必要补充。
