论文

通过设备设置的软提示提取安全的 LLM 系统

Distilling Safe LLM Systems via Soft Prompts for On Device Settings

摘要

在资源受限的边缘设备上部署安全的 大语言模型 (LLM) 提出了严峻的挑战:虽然将 LLM 与防护模型相结合的双模型系统提供了有效的安全保证,但其大量的内存和计算需求使得它们在设备上部署的成本过高。本文对资源受限环境下参数有效的安全对准方法进行了全面研究。通过对多个 LLM 架构、训练目标和参数高效的 微调 方法进行系统评估,我们发现软提示与基于 蒸馏 的训练相结合始终优于替代方法。我们引入了基于总变分和 KL 散度的 蒸馏 框架,该框架有效地将安全行为从警卫模型转移到学习的软提示中。我们对各种基准的评估表明,与 LoRA 适配器、引导向量和直接优化方法相比,这种组合实现了卓越的安全性与实用性权衡,同时在推理时需要最少的额外内存和计算。这些发现将软提示 蒸馏 确立为设备上 LLM 部署中安全对齐的首选方法。