论文

守住角色,守住安全:面向安全角色扮演智能体的双循环对抗自演化

Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents

上下文与知识检索增强

摘要

基于 LLM 的角色扮演在保真度上快速提升,然而对角色约束更强的遵循通常会增加对越狱攻击的脆弱性,对高风险或负面角色尤甚。多数既有工作用训练时方案(如数据整理或面向对齐的正则化)缓解这一问题。但随着角色与攻击策略的演化,这些方法维护成本高、可能损害角色内行为,且对前沿闭权重 LLM 通常不可行。我们提出一个免训练的双循环对抗自演化框架,包含两个耦合循环。角色定向攻击者循环合成逐步更强的越狱提示;角色扮演防御者循环把观察到的失败蒸馏为分层的知识库:(i) 全局安全规则,(ii) 角色角色约束约束,(iii) 安全的角色内示例。推理时,防御者从该层级检索并组合结构化知识以引导生成,产出既忠实于目标角色又满足安全约束的回应。在多个专有 LLM 上的大量实验显示,该方法在角色保真度与抗越狱两方面均持续超越强基线,并对未见角色与攻击提示具有稳健泛化。

守住角色,守住安全:面向安全角色扮演智能体的双循环对抗自演化
图2:DASE 框架概览。该系统在 Role-Playing Defender 与 Persona-Targeted Attacker 之间编排一场免训练的对抗博弈。它不更新模型参数,而是持续演化一个 Hierarchical Knowledge Base,通过迭代交互循环同时提升安全鲁棒性与角色保真度。