论文

微调 是否撤消激活转向?无需体重编辑逆转的行为恢复

Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal

模型评测模型行为与机制分析

摘要

激活控制可以直接嵌入到语言模型的权重中,无需推理时间干预即可塑造行为,并提供一种在发布之前对对齐进行编码的方法。然而,模型在部署后通常会进行微调,并且尚不清楚嵌入式干预是否能够幸存。我们研究了非对抗性 SFT 和 RLHF 下五个指令调整模型 (3B-14B) 中用于拒绝抑制和简洁归纳的嵌入式转向的稳定性。行为上,保存跟踪训练数据:当优化压力与目标行为相矛盾时,转向性能会下降,否则持续存在,拒绝消融在 SFT 下平均会损失 64% 的效果。然而,从机制上讲,即使行为恢复,权重编辑也几乎保持不变:平均向量恢复为 $ρ= 0.004$,并且沿转向方向的 微调 更新几乎与其预编辑权重模式正交(平均 $\cosθ= 0.074$)。当转向性能下降时,微调 不会通过拆卸或反转转向机构本身来实现这一点。因此,嵌入式转向在机械上是耐用的,但在功能上很脆弱,并且需要在下游训练后进行行为重新验证。