论文

以越狱实现保护:通过临时越狱进行缓冲与强化,实现大语言模型的安全微调

Jailbreak to Protect: Buffering and Reinforcing via Temporary Jailbreaking for Safe Fine-Tuning in Large Language Models

模型训练参数高效训练

摘要

微调即服务(Fine-tuning-as-a-Service,FaaS)支持大语言模型(LLM)的个性化定制,但在有害微调攻击下会削弱安全对齐。近期研究表明,在微调期间激活有害行为模块可以防止模型习得不期望的行为,但其机制仍不清楚。本文重新审视将临时越狱作为有害微调防御手段的做法,并给出梯度层面的分析,表明它能在保留良性任务相关梯度的同时使降低安全性的梯度饱和。基于这一洞见,我们提出缓冲-强化(Buffer-and-Reinforce)微调框架,在用户微调期间缓冲有害更新,并在适配完成后强化安全性。具体而言,BufferLoRA诱导临时越狱作为一个可移除的适配器,以减少用户微调期间的有害更新。适配完成后,经过训练以在临时越狱状态下恢复拒绝行为的ReinforceLoRA,通过基于QR分解的合并与UserLoRA集成,在保持用户任务性能的同时强化安全性。大量实验表明,我们的框架在用户微调期间无需额外安全数据、计算成本极小的情况下,取得了更优的安全性与实用性。

以越狱实现保护:通过临时越狱进行缓冲与强化,实现大语言模型的安全微调:论文配图
图 1:根据有害和无害数据评估的安全型LLM和越狱LLM的 2D 损失情况。较暖(较冷)的区域表示较高(较低)的损失,星号标记 (✩) 当前模型参数。越狱的LLM在很大程度上集中在有害数据上,而安全相关的LLM则没有,而两种模型都保留了对无害数据进行优化的空间,如红色箭头所示。损失景观是使用安全对齐和越狱的 LLaMA3-8B-Instruct 参数点周围的 2D 随机平面投影获得的。