论文
MOSAIC:基于模块化控制token的可组合安全对齐
MOSAIC: Composable Safety Alignment with Modular Control Tokens
摘要
大语言模型(LLM)的安全对齐通常实现为嵌入模型参数中的单一静态策略。然而,现实部署往往需要因用户、地区和应用而异的上下文相关安全规则。现有方法难以提供这种条件控制:参数级对齐使安全行为与通用能力相互纠缠,而基于提示的方法依赖自然语言指令,约束力较弱。我们提出MOSAIC,一个模块化框架,通过在冻结骨干模型上优化的可学习控制令牌实现可组合的安全对齐。每个令牌代表一条安全约束,可在推理时灵活激活和组合。为高效训练可组合令牌,我们引入基于顺序的任务采样和一种缓解过度拒答的分布级对齐目标。实验表明,MOSAIC在保持模型效用的同时,以显著更低的过度拒答实现了强劲的防御性能。
