论文

CLEAR:面向效用保持的LLM安全对齐的连续潜空间适配器路由

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

模型训练参数高效训练

摘要

提升大语言模型(LLM)的安全性常以牺牲效用为代价,因为全局施加的安全微调可能同时影响模型对有害与良性输入的回应。我们提出CLEAR(连续潜空间适配器路由),一个条件化安全适配框架,用轻量的隐状态门控连续控制安全低秩适配器的激活强度。CLEAR旨在减少有害补全,同时避免对冻结骨干做可能损害良性提示性能的不必要改动。在广泛使用的安全与效用基准上的实验表明,CLEAR提升了HarmBench上的鲁棒性,同时减少了全局施加的安全微调(如SFT或标准低秩适配LoRA)所观察到的效用退化。在Llama-3-8B-Instruct上,CLEAR把HarmBench ASR从32.3%降到0.5%,同时保留基座模型的大部分效用,GSM8K准确率比全局SFT或LoRA最高高出7.1个百分点。这些结果表明,CLEAR是改善LLM对齐中安全—效用权衡的一种有前景的机制。

CLEAR:面向效用保持的LLM安全对齐的连续潜空间适配器路由:论文配图
图1:CLEAR 概览,一个用于保持效用的LLM安全对齐的连续潜在适配器路由框架。给定输入提示,冻结的基座LLM先生成隐藏表示,从中提取选定的潜在状态并传递给轻量级安全门控。门控预测连续路由分数 g(x)∈[0,1],该分数控制安全LoRA适配器的强度。对于良性提示,路由分数保持较低,模型行为接近冻结骨干;对于有害或对抗性提示,分数升高,安全适配器被激活,将生成引向符合对齐目标的拒绝行为。