论文
守住角色,守住安全:面向安全角色扮演智能体的双循环对抗自演化
Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents
摘要
基于 LLM 的角色扮演在保真度上快速提升,然而对角色约束更强的遵循通常会增加对越狱攻击的脆弱性,对高风险或负面角色尤甚。多数既有工作用训练时方案(如数据整理或面向对齐的正则化)缓解这一问题。但随着角色与攻击策略的演化,这些方法维护成本高、可能损害角色内行为,且对前沿闭权重 LLM 通常不可行。我们提出一个免训练的双循环对抗自演化框架,包含两个耦合循环。角色定向攻击者循环合成逐步更强的越狱提示;角色扮演防御者循环把观察到的失败蒸馏为分层的知识库:(i) 全局安全规则,(ii) 角色角色约束约束,(iii) 安全的角色内示例。推理时,防御者从该层级检索并组合结构化知识以引导生成,产出既忠实于目标角色又满足安全约束的回应。在多个专有 LLM 上的大量实验显示,该方法在角色保真度与抗越狱两方面均持续超越强基线,并对未见角色与攻击提示具有稳健泛化。
