论文

学习攻击和防御:通过 GRPO 进行语言模型的自适应红队

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

模型训练强化学习

摘要

人工智能红队必须不断适应不断变化的攻击者和防御者。强化学习提供了一种有前途的发现新颖攻击的方法,而协同训练方法可以同时产生更强大的防御者。最近的工作证明了通过应用 PPO 和 DPO 进行攻防协同训练的有效性,但报告指出 GRPO 在这种情况下不稳定。我们引入了 AdvGRPO,这是一个协同训练框架,它使 GRPO 可以使用密集的多通道奖励和解耦优势标准化来进行联合攻击者-防御者优化。训练按照从单轮攻击到闭环多轮攻击的课程进行,然后进行引导协同训练,其中攻击者和防御者模型交替更新。我们证明,我们的方法可以产生高效且可转移的攻击,并且共同训练的防御者在安全基准方面的表现优于基线。