论文
同策略 一致性训练以最小的能力下降提高 LLM 安全性
On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation
摘要
一致的模型可能会在多种方面表现不佳:它们通常是阿谀奉承、成为越狱的受害者,或者未能包含适当的安全警告。一致性训练是一种有前途的新对齐范例,通过使用对比输入对将不变量训练到模型中来减轻此类失败。现有的一致性训练程序离线生成监督信号一次,并使用监督 微调 (SFT) 来更新模型。不幸的是,由此产生的模型往往仅仅记住训练分布的表面形式,因此泛化能力较差并且其能力有所退化。我们引入了 同策略 一致性训练 (OPCT),这是一种新的一致性训练方法,其中目标是根据模型自身对提示的响应计算的,并根据相应的对比提示进行自身监督。我们从三个安全轴评估 OPCT:阿谀奉承、越狱和安全意识。在三个模型系列中,OPCT 在所有安全需求方面均优于 SFT 同类产品。相对于基线,它使阿谀奉承率几乎减半(8.1% vs. 15.4%,而 SFT 为 11.2%)。在自适应的按目标攻击者的情况下,OPCT 在越狱行为上的越狱防御成功率接近 99%,而 SFT 平均达到 87%。在安全意识方面,OPCT 在三个模型中的两个模型中优于 SFT,并在另一个模型中与之匹配。 OPCT 还很大程度上避免了 SFT 导致的能力下降,例如 MATH-500 下降 28 分。我们的结果表明,一致性训练最好以 OPCT 而非 SFT 的形式实施,特别是当需要超出训练分布的泛化时。