论文

STR:替换MLP模块,减少模型行为引导的副作用

STR: Supervised Transcoder Replacement for Reducing Steering Side Effects

模型训练模型编辑与遗忘

摘要

模型引导可以强化目标行为,同时降低其他有用的行为。我们引入了监督转码器替换(STR)来减少现有转向方法(包括那些没有保护目标的方法)的副作用。 STR 通过目标控制、非目标保留和无转向保真度的监督,学习转向层多层感知器 (MLP) 计算的替代方案。然后,选定的转向方法将方向安装到冷冻替换件上,同时保留其自己的安装目标。我们使用 Corrigibility 偏好和四个有害请求安全数据集评估了 Gemma 和 Llama 模型的三种转向方法。 SALAD-Bench 提供保护训练数据和单独的分布评估数据; HarmBench、AdvBench 和 StrongREJECT 保留用于分布外测试。 STR 大大减少了对分布内评估的转向副作用,并将这种保护扩展到看不见的安全数据集,同时保留有效的目标控制。对于仅目标的监督引导向量,Gemma-3-4B 上的集中分布外攻击成功率从 42.46% 下降到 14.42%,Gemma-3-12B 上从 34.97% 下降到 12.91%。这些结果表明,替代训练可以使没有保护目标的转向方法受益。