论文
角色扮演越狱中的安全中继:危害识别和拒绝的组件解析因果分析
The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal
摘要
大语言模型 经过培训,可以遵循指示,同时拒绝有害请求。越狱利用这种平衡来引出模型通常会拒绝的内容。角色扮演越狱尤其令人担忧:有害请求可以在由角色、场景和任务组成的角色扮演包装器中保持可见,但模型可能会遵守。我们使用机械可解释性来确定这种背景如何逆转拒绝以及哪些元素促成逆转。在两个基准、三个模型系列和四个编写的包装器中,我们比较了使用和不使用此包装器的匹配的有害和良性请求。我们跟踪从请求到最终提示状态的隐藏状态对比,通过受控的反事实隔离包装器操作,干预保留的评估请求中的激活方向,并以几何方式分解有效方向。我们的分析得出三个结论。 (1) 成功的攻击在请求时保留了所测量的有害与良性的区别,而其拒绝相关的表达在答案开始处减弱,我们将这种模式称为安全中继衰减。 (2) 围绕请求构建完整的角色扮演并将其构建在场景中,有助于因果关系:删除相关的激活更改可以恢复拒绝。 (3) 这些效果在很大程度上共享内部结构,并且大多数修复是通过与模型在没有角色扮演的情况下通常拒绝有害请求一致的组件来再现的;场景框架保留了一个较小的、依赖于模型的组件。总之,这些发现解释了角色扮演如何在保留伤害证据的情况下产生合规性,并确定了未来保障措施的具体目标:保持从伤害识别到拒绝的联系。