论文
CLEAR:面向效用保持的LLM安全对齐的连续潜空间适配器路由
CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment
摘要
提升大语言模型(LLM)的安全性常以牺牲效用为代价,因为全局施加的安全微调可能同时影响模型对有害与良性输入的回应。我们提出CLEAR(连续潜空间适配器路由),一个条件化安全适配框架,用轻量的隐状态门控连续控制安全低秩适配器的激活强度。CLEAR旨在减少有害补全,同时避免对冻结骨干做可能损害良性提示性能的不必要改动。在广泛使用的安全与效用基准上的实验表明,CLEAR提升了HarmBench上的鲁棒性,同时减少了全局施加的安全微调(如SFT或标准低秩适配LoRA)所观察到的效用退化。在Llama-3-8B-Instruct上,CLEAR把HarmBench ASR从32.3%降到0.5%,同时保留基座模型的大部分效用,GSM8K准确率比全局SFT或LoRA最高高出7.1个百分点。这些结果表明,CLEAR是改善LLM对齐中安全—效用权衡的一种有前景的机制。
