论文
深思熟虑的一致性很深,但不确定性仍然存在:通过将不安全行为归因于基础模型,提高推理时的推理时间安全性
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
摘要
虽然 大语言模型 (LLM) 中拒绝训练的广泛采用展示了模型安全性的改进,但最近的工作凸显了由于这些对齐方法的浅层性质而导致的缺点。为此,协商对齐工作提出从更强的推理模型中提炼推理能力,从而在 LLM 中注入更深层次的安全性。在这项工作中,我们研究了语言模型中协商对齐的影响。首先,我们表明,尽管模型规模更大且安全能力更强,但教师和学生语言模型之间存在对齐差距,这影响了学生模型的安全性和通用性。此外,我们表明,尽管学习了更大推理模型的推理模式,但通过深思熟虑的对齐方式对齐的模型可以保留基本模型的不安全行为。基于这一观察,我们提出了一种 BoN 采样方法,将不安全行为归因于潜在空间中的基本 LLM,从而降低不安全响应的排名,从而在多个安全基准上获得模型安全性的有意义的改进,同时将效用损失最小化。特别是,在不同班级和规模的 7 个教师模型和 6 个学生模型中,我们发现 DAN 中的平均攻击成功率 (ASR) 降低了 28.2%,WildJailbreak 中降低了 31.3%,StrongREJECT 基准中降低了 35.4%。我们进一步表明,这些安全收益在强化学习训练后占主导地位,从而突出了安全推理的不确定性及其对基础模型的明确归因。