论文

不要仅通过激活来判断LLM:通过反事实激活潜力发现被抑制的安全功能

Don't Judge an LLM Only by Its Activations: Discovering Suppressed Safety Features via Counterfactual Activation Potential

模型评测模型行为与机制分析

摘要

机械解释性已成为理解LLM安全行为的主要手段。然而,现有的工具主要关注激活神经元或模型的特征。对于此类方法来说,剩余的大量非活动组件的作用是不可见的。这项工作表明,非活动集包含与拒绝有害提示有因果关系的安全关键特征。抑制此类功能可能会将拒绝转变为遵从,同时不会被流行的可解释性工具检测到。我们引入了反事实激活电位(CAP),该指标将被抑制特征的潜在激活趋势量化为编码器对齐(输入驱动它的强度)、抑制强度(活动特征抑制它的强度)和安全关键性(拒绝的程度取决于它)的乘积。为了大规模地找到被抑制的安全特征,我们提出了 CAP 引导的安全特征发现(CSFD),这是一种两阶段过滤算法,可以从数十万个转码器特征中识别候选安全特征,而无需详尽的消融。当候选功能被取消时,很大一部分试验会遵循有害的提示。在自然越狱的情况下,对最高 CAP 功能的抑制会上升 2-4 倍,而它们的激活也会相应下降高达 80%。放大功能的抑制器会降低其激活并提高与被抑制功能相关的提示的有害遵从性,但对于随机功能则没有这种效果。我们的实验涉及不同参数尺寸的五种 Gemma、Qwen 和 Llama 模型。我们的研究结果表明,越狱可以部分通过抑制安全关键功能而不是仅仅激活有害功能来进行,并且抑制功能是对以激活为中心的安全行为可解释性的必要补充。

不要仅通过激活来判断LLM:通过反事实激活潜力发现被抑制的安全功能的原论文方法或结果图
图 1:抑制假设:越狱可以使安全功能静音,而不会激活任何有害的东西。 (a) 对于有害请求,安全功能处于活动状态并且模型拒绝。 (b) 关闭该功能会将输出翻转为合规;所以拒绝确实取决于它。 (c) 重新构建与小说相同的请求,招募抑制它的故事特征:虚线轮廓标记其输入将驱动它达到的水平,橙色箭头表示抑制它。基于激活的工具将保留的功能视为任何未使用的功能。然而,CAP 通过其编码器对齐、作用于其上的抑制及其重要性而不是通过其是否触发来对功能进行评分,因此它在所有三种情况下都标记了安全功能。提示是说明性的。