论文

MAGIC:用于鲁棒LLM安全的攻防协同演化对抗博弈

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

模型训练强化学习Agentic RL

摘要

确保稳健的安全对齐对大语言模型(LLMs)至关重要,然而现有防御由于依赖静态的、预先收集的数据分布,往往落后于不断演化的对抗攻击。在本文中,我们提出MAGIC,一个新颖的多轮多智能体强化学习框架,将LLM安全对齐表述为一场非对称对抗博弈。具体而言,攻击者agent学习将原始查询迭代改写为欺骗性提示,而防御者agent同时优化其策略以识别并拒答此类输入。这一动态过程触发共同演化:攻击者不断变化的策略持续挖掘长尾漏洞,驱使防御者泛化到未见过的攻击模式。值得注意的是,我们观察到被赋予初始推理能力的攻击者通过迭代RL训练演化出新颖的、先前未见的组合策略,这凸显了本方法的巨大潜力。在理论上,我们为更稳健的博弈均衡提供洞见,并推导出安全保证。大量实验验证了该框架的有效性,在不损害模型有用性的前提下取得更优的防御成功率。代码发布于 https://github.com/BattleWen/MAGIC。

MAGIC:用于鲁棒LLM安全的攻防协同演化对抗博弈
图2:MAGIC 概览。该框架分两个阶段运行:阶段 1(初始化)通过在富含 CoT 的数据上进行 SFT 预热训练攻击者,使其具备推理能力。阶段 2(迭代协同进化)采用 GRPO 逼近博弈均衡,在优化防御者以实现稳健拒绝与优化攻击者以获得自适应越狱策略之间交替进行。