论文
双重对抗安全联盟:培养 LRM 的内在威胁理解
Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs
摘要
大型推理模型 (LRM) 在复杂任务上取得了显着的成功,但仍然容易受到有害提示的影响,从而导致不安全的输出。最近的方法使用直接拒绝或安全理由来调整 LRM,但通常关注提示模式而不是内在攻击机制。因此,这些以模式为中心的对齐很难在不同的越狱中推广,从而损害了对抗的稳健性和推理效用。我们提出了 AdvSafe,这是一个双重对抗框架,使 LRM 通过明确解构对抗机制来内化不安全知识。这超越了依赖于模式的痕迹,在不影响推理效用的情况下促进了强大的认知防御。我们的管道通过两阶段对抗游戏进行运作。首先,在对抗性综合中,自主代理动态地制作欺骗性的越狱提示,调整其策略来破坏强大的教师模型。其次,在对抗性提取中,被破坏的教师执行认知反击。对于每一次成功的越狱,老师都会揭开伪装,解释攻击为何成功以及如何识别和缓解此类提示。这种双重对抗过程产生了一个紧凑的推理数据集,捕获了丰富的、可概括的不安全知识。在此数据集上训练的学生模型通过内在威胁理解隐式获得安全一致性。实验表明,仅用 1K 合成样本,AdvSafe 对齐的 LRM 就可以实现比现有基线更强的越狱鲁棒性,并且几乎没有效用下降。此外,AdvSafe 提高了针对分发外提示的鲁棒性,表明学习不安全知识可以实现卓越的鲁棒性与实用性权衡,并概括出超出可见的攻击模式。