论文
SafeAnchor:防止大语言模型持续域适应中的累积安全侵蚀
SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models
摘要
大语言模型 中的安全对齐非常浅:它集中在前几个输出词元中,并且可以通过 微调 在少至 100 个对抗性示例上进行逆转。这种脆弱性在现实世界的部署中变得至关重要,模型在医学、法律和代码等领域进行顺序适应,导致安全护栏逐渐受到侵蚀。然而,所有现有的安全保护方法仅针对单任务 微调,而完全未解决多域顺序设置。我们引入了 SafeAnchor,这是一个在不断适应过程中将安全锚定到位的框架。 SafeAnchor 首先通过 Fisher 信息特征分解识别 LoRA 参数空间中的低秩安全子空间,然后将特定领域的梯度更新约束到这些子空间的正交补集,最后通过阈值触发的校正重放来监视残余安全漂移。在 Llama-2-7B-Chat 和 Mistral-7B-Instruct 上跨三域管道和八个基准进行评估,SafeAnchor 保留了 93.2% 的原始安全对齐,比所有基线高出 18-42 点,同时在域任务上将不受约束的 微调 匹配到 1.5 点以内。