论文

镜中的攻击者:经锚定双策略自博弈打破安全自洽

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

模型训练强化学习

摘要

自博红队是一种提高人工智能安全性的既定方法,其中同一模型的不同实例在零和游戏中扮演攻击者和防御者角色,即攻击者试图越狱防御者;如果自我博弈收敛到纳什均衡,则保证模型在博弈设置内安全地做出响应。尽管通过对两个角色使用相同模型来强制执行参数共享提高了稳定性和性能,但它引入了基本的理论和架构限制。我们证明,可以达到的纳什均衡集对应于一大类行为,其中包括琐碎的总是拒绝策略和类似神谕的防御者,从而限制了实际适用性。然后我们表明,当攻击者和防御者共享并更新相同的基础模型时,动态崩溃为自我一致性,因此攻击不会对防御者施加对抗压力。作为回应,我们提出了锚定双策略自我博弈(Anchored Bipolicy Self-Play),它在冻结的基础模型之上训练不同的特定角色 LoRA 适配器,从而保持稳定的优化,同时通过明确的角色分离保持对抗压力。就标准自我对战而言,我们的参数效率比微调高出 100 倍,并且与自我对战微调模型相比,安全性得到了持续改进。我们在广泛使用的安全基准上对 Qwen2.5-{3B,7B,14B}-IT 模型进行了评估,结果显示鲁棒性有所提高,而推理能力却没有损失。交叉游戏实验进一步表明,我们的攻击者和防御者模型在对抗性防御和安全性方面优于自我游戏。

镜中的攻击者:经锚定双策略自博弈打破安全自洽:论文配图
图3:Self-RedTeam和ABS在有害行为数据集上的攻击的UMAP投影;基础型号为Qwen2.5-{7B,14B}。尽管我们的 ABS 攻击在词汇上与 Self-RedTeam 不同,但嵌入空间中的投影是相似的。表 3 中的词法分析解决了这种明显的不一致问题。