论文
HyperSafe:微调语言模型的推理时安全恢复
HyperSafe: Inference-Time Safety Recovery for Fine-Tuned Language Models
摘要
大语言模型 中的安全对齐在 微调 下可能很脆弱,因为即使是良性的任务适应也可能会增加有害的合规性。现有的防御主要遵循两个方向:它们要么通过重新训练或权重修改在 微调 期间或之后进行干预,这可能成本高昂并且可能会损害任务性能,要么它们使用与模型无关的安全分类器,这可能会错过特定于给定微调检查点的故障。这些限制激发了事后、特定模型和非侵入性的安全恢复方法。为了满足这些要求,我们提出了 HyperSafe,这是一个通过为每个微调检查点生成特定于模型的安全侧网络 (SSN) 来恢复安全行为的框架。 HyperSafe 使用分层激活指纹来捕获 微调 如何更改模型的内部表示。通过一小组给定的校准提示,超网络在一次前向传递中将这些指纹映射到 \ssn{} 的参数。生成的 \ssn{} 与冻结的微调模型一起运行,并执行提示级安全分类:有害提示被路由到拒绝,而安全提示则由原始微调模型回答。因此,HyperSafe 不需要梯度更新,部署时不需要安全数据,也不需要修改已部署的模型权重。我们在两个型号系列 Qwen2-7B 和 LLaMA-3-8B 上跨多个安全基准评估 HyperSafe。 HyperSafe 将每个保留检查点的有害响应率从 19-31% 降低到 1% 以下,同时将下游任务的准确性平均保持在微调基线的 1% 以内。代码可在 https://github.com/nokronim/project-safety-remedy 获取。