论文
CHASE:使用强化学习提高 LLM 安全性的对抗性红蓝团队
CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning
摘要
尽管安全调整方面取得了进步,但即使在前沿模型上,即时重写攻击(例如角色调制、虚构框架和基于说服的重新表述)也可以绕过安全过滤器。现有的防御要么依赖于不可扩展的人工管理,要么依赖于过度适应特定模型内部结构的白盒优化,使得对齐的模型在部署时面临的自适应黑盒对手面前变得脆弱。为了解决这一差距,我们引入了 CHASE(通过对抗性安全升级进行共同进化强化),这是一个闭环红蓝团队框架,其中黑盒攻击者和安全一致的防御者共同进化。攻击者通过组相对策略优化 (GRPO) 在乘法奖励下进行训练,共同强制执行旁路有效性和意图保真度,而防御者则通过两阶段 GRPO + 拒绝采样 SFT 管道与良性数据平衡,对收获的对抗性重写进行强化。在 BeaverTails 和 JailbreakBench 上针对五个持续攻击系列(PAIR、TAP、AutoDAN、PAP、Translation)进行评估,CHASE 削减意味着 StrongREJECT 分数提高了 43.2\%,良性提示的错误拒绝率为 0\%。除了标题结果之外,CHASE 还表明,无模板的 RL 探索可以恢复在机制上不同的攻击家族之间转移的潜在攻击原语,这表明了一条通向 LLM 安全强化的道路,该安全强化超越了迄今为止在对抗性训练中实现的狭窄分布。