论文
实现 大语言模型 的上下文不变安全对齐
Towards Context-Invariant Safety Alignment for Large Language Models
摘要
基于偏好的 后训练 使 LLM 与人类意图保持一致,但安全行为通常仍然脆弱。模型可能会拒绝标准提示中的有害请求,但当相同的意图包含在对抗性措辞中时,模型会遵守。我们建议稳健的安全性需要上下文不变的对齐,其中行为取决于潜在的意图而不是表面形式。强制执行不变性很难保持一致,因为并非所有训练信号都同样值得信赖;对于某些提示变体,我们可以获得可验证的反馈(例如,多项选择),而对于开放式变体,我们通常依赖于嘈杂的、可游戏的奖励代理(例如,博学的法官)。因此,标准对称不变性正则化器可以通过降低可靠变体的性能来减少跨上下文差异,而不是提高开放式鲁棒性。为了解决这个问题,我们引入了锚定不变正则化(AIR),它将可验证的提示视为锚点,并使用停止梯度目标仅对锚点性能的开放式变体进行正则化。 AIR 作为插件辅助损失实现,并通过异构提示分组与基于组的偏好优化(例如 GRPO)相结合。在安全、道德推理和数学方面,AIR 改善了上下文不变性,将分布内组内准确率提高了 12.71%,将分布外一致性提高了 33.49%,使安全约束对对抗性框架具有鲁棒性。