论文

RefusalGuard:几何保留 微调 以确保 LLM 中的安全

RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

模型训练监督微调与指令调优

摘要

用于下游任务的 微调 安全对齐语言模型通常会导致拒绝行为大幅退化,使模型容易受到对抗性滥用。虽然之前的工作表明,安全相关的特征被编码在模型激活空间内的结构化表示中,但这些表示在 微调 期间如何变化以及对齐降级的原因仍然知之甚少。在这项工作中,我们研究了对齐退化背后的表示级机制。我们的分析表明,标准 微调 会引起安全相关表示的系统漂移,扭曲其几何结构,并在任务优化和安全功能之间引入干扰。这些影响共同导致有害合规性的增加。受这些发现的启发,我们引入了 REFUSALGUARD,这是一个表示级 微调 框架,可在模型适应期间保留安全相关的结构。我们的方法限制隐藏表示空间中的更新,确保安全中介组件保持稳定,同时允许在互补方向上进行特定于任务的学习。我们在 AdvBench、DirectHarm4 和 JailbreakBench 等对抗性安全基准以及下游实用任务上跨多个模型系列(包括 LLaMA、Gemma 和 Qwen)评估 REFUSALGUARD。我们的方法实现了与基本安全模型相当的攻击成功率,同时保持有竞争力的任务性能,显着优于基线。