论文
修剪不安全票据:一个资源高效的框架,实现更安全、更稳健的 LLM
Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs
摘要
机器学习模型越来越多地部署在现实世界的应用中,但即使是 Mistral 和 LLaVA 等对齐模型仍然表现出从 预训练 继承的不安全行为。当前的对齐方法(例如 SFT 和 RLHF)主要鼓励模型生成首选响应,但没有明确删除触发有害输出的不安全子网络。在这项工作中,我们引入了一种资源高效的修剪框架,该框架可以直接识别和删除与不安全行为相关的参数,同时保留模型的效用。我们的方法采用无梯度归因机制,仅需要适度的 GPU 资源,并且可以跨架构和量化变体进行推广。对机器学习模型的实证评估表明,不安全代数大幅减少,针对越狱攻击的鲁棒性得到提高,且效用损失最小。从彩票假说的角度来看,我们的结果表明机器学习模型包含导致有害行为的“不安全门票”,而修剪揭示了在调整输出的同时保持性能的“安全门票”。这提供了一种轻量级的事后调整策略,适合在资源受限的环境中部署。