论文

在 大语言模型 中制作可逆 SFT 行为

Crafting Reversible SFT Behaviors in Large Language Models

模型训练模型编辑与遗忘

摘要

受监督的 微调 (SFT) 在 大语言模型 中引入新行为,但对这些行为在模型中的分布方式没有施加结构约束。现有的行为解释方法(例如电路归因方法)可识别与 SFT 诱发行为事后相关的稀疏子网络。然而,这种相关性并不意味着“因果必然性”,限制了在推理时选择性控制 SFT 引发的行为的能力。我们通过询问来寻求替代方案:是否可以将 SFT 引发的行为故意压缩为稀疏的、机械上必要的子网络(称为“载体”),同时在不修改权重的情况下在推理时保持可控?我们提出(a)**损失约束双下降(LCDD)**,它通过在明确的效用预算下联合优化路由掩码和模型权重来构造此类载波,以及(b)**SFT-Eraser**,一种通过提取的载波通道上的激活匹配进行优化的软提示,以逆转 SFT 引起的行为。跨多个模型系列的安全性、固定响应和风格行为,LCDD 产生稀疏载体,保留目标行为,同时在 SFT-Eraser 触发时实现强大的恢复。 Ablations 进一步证实稀疏结构是逆转的关键先决条件:相同的触发优化在标准 SFT 模型上失败,证实结构而不是触发设计是操作因素。这些结果提供了直接证据,表明学习到的载体对于这些行为是因果必要的,为系统地定位和选择性抑制部署模型中 SFT 引起的行为指明了新方向。