论文

激活指导何时会改变模型的计算依据?

When Does Activation Steering Change What a Model Computes From?

模型评测模型行为与机制分析

摘要

激活控制可以通过修改代理的内部激活来可靠地改变代理的输出。然而,得到相同的答案不需要涉及相同的计算:行为等效并不意味着机械等效。我们测试激活编辑是否会更改后续计算中使用的状态或使计算偏向所需的输出。在受控状态跟踪任务中,跟踪监督创建一个可编辑寄存器:更改其内部值使模型将下一个操作应用于编辑状态。接下来我们要问广泛使用的平均激活转向是否承认类似的解释:转向是否重新创建了模型在执行任务时自然使用的内部配置?如果是这样,移植该激活应该是有效的,并且引导应该在自然源到目标激活变化的范围内保持有效。这两个预测在两个选定的模型任务设置中均不成立。替换一层的激活会产生不到 2% 的目标答案裕度增益,因为通过修补所有剩余层,而自然尺度控制同样无效。转向矢量的范数是 Qwen 和 Llama 中值自然变化的 77 和 26 倍,产生了 54% 和 82% 的参考效果。因此,成功的引导干预不需要在干预层重现自然目标激活。更一般地,只有当稍后的计算根据该状态的语义使用编辑的值时,干预才应被解释为改变计算状态。