论文

Compliance2LoRA:通过超网络生成的 LoRA 适配器对任意策略子集进行个性化按需安全调整

Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters

模型训练监督微调与指令调优

摘要

大型推理模型 (LRM) 中的 后训练 对齐显着提高了它们对不同安全合规设置的适应性。然而,随着下游用户的 LRM 个性化成为焦点,对不同级别的策略合规性的需求不断增长,因为不同的用户特定 LRM 必须遵守不同的安全策略子集。为每个策略子集训练单独的 LRM 会带来严重的组合开销。虽然上下文学习方法克服了这种组合开销,但它们引入了与长上下文生成相关的额外计算挑战。为了应对这一挑战,我们提出了一个基于统一自适应超网络的多策略合规框架。在我们的框架中,安全策略作为 LoRA 适配器生成器的可定制输入,该生成器学习为下游 LRM 生成符合策略的 LoRA 权重。当添加到 LRM 时,这些权重可以生成符合指定策略子集的响应。在这项工作中,我们证明训练这样的超网络可以在单个 LRM 上进行按需策略调整,而不会牺牲不同大小和不同评估数据集的推理模型的任务性能。这凸显了 LRM 中基于自适应超网络对齐的有效性和实用性。