论文
Palette:按需授权放宽LLM安全对齐的模块化、可控且高效框架
Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs
摘要
当前基础模型的安全对齐大多遵循一刀切范式,对所有用户与情境施加同样的拒答策略。结果,模型可能拒绝那些对普通用户不安全、但对获授权专业人员合法的请求,限制了在专门职业场景中的有用性。现有方法要么需要代价高昂的重新对齐,要么依赖推理时引导,而后者控制不精确且增加延迟。为此,我们提出Palette,一个模块化、可控且高效的框架,在获授权的目标领域选择性放宽拒答行为,同时在其他方面保持标准安全性。我们的方法通过多目标搜索识别拒答方向,并通过轻量适配将其内化到模型中。Palette还支持模块化组合:它独立学习领域特定的安全控制,并通过参数合并将它们组合起来,无需重训练即可按需实现多领域授权。在四个安全基准、多个模型变体以及LLM与VLM上的实验表明,Palette能在不牺牲通用效用的情况下实现精细的安全控制,为基础模型适应多样专业需求提供了一条可行路径。
