论文
通过激活一致性训练减轻针对推理模型的自适应攻击
Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training
摘要
随着 LLM 获得更强的推理能力,其扩展的思想链为防御对抗性越狱和即时注入带来了新的复杂性。我们研究一致性训练,这是一系列 微调 目标,这些目标在干净的提示和对抗性重写上强制执行相同的行为,并在五个推理模型中评估其两个主要变体:输出级别 (BCT) 和激活级别 (ACT)。我们将这两种方法都制定为即时注入防御,并发现 ACT 与其他基于训练的防御具有竞争力,同时只需要自我监督的干净和包装提示对。我们的实验还在越狱环境中推广了这两种技术,证明 ACT 对于自适应攻击仍然更加稳健。我们还提供了机械证据,表明 ACT 对越狱的防御被编码为辅助转弯边界处激活空间的大致线性变化。经过 ACT 训练后,我们可以恢复一个单一的转向方向,控制推理模型的拒绝,同时对良性输入的影响最小。我们发现,即使模型的思想链被来自不设防的基础模型的合规跟踪所取代,ACT 仍然保持稳健,并转向拒绝预填充越狱。总之,这些结果表明,监督内部表征对于推理模型中各种形式的安全训练来说是一种令人惊讶的有效且可解释的方法。