论文
将意图与角色解耦:面向角色不变安全对齐的对抗自博弈
Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
摘要
大语言模型(LLM)能力的增长推动了其在各领域的广泛部署,甚至包括潜在高风险场景。尽管安全对齐技术不断进步,当前模型对新兴的基于角色的越狱攻击仍然脆弱。现有关于角色越狱的研究主要聚焦于攻击迭代,但在防御端缺乏系统性与机制性约束。为应对这一挑战,我们提出Persona-Invariant Alignment(PIA),一个对抗自博弈框架,通过攻击端的Persona Lineage Evolution(PLE)与防御端的Persona-Invariant Consistency Learning(PICL)实现协同演化。理论上,PICL建立在结构分离假说之上,利用单边KL散度约束实现安全决策与角色上下文的结构性解耦,从而在角色越狱攻击下保持安全行为。实验结果表明,PLE通过基于血缘的信用传播高效探索高风险角色空间。同时,PICL防御方法在保持模型通用能力的同时显著降低攻击成功率(ASR),验证了该对齐范式的优越性与鲁棒性。代码发布于https://github.com/JiajiaLi-1130/PIA。
