论文
从概念一致的词元到易受攻击的特征:越狱的机制定位
From Concept-Aligned Tokens to Vulnerable Features: Mechanistic Localization of Jailbreaks
摘要
越狱攻击暴露了安全一致的 LLM 中的持久故障模式:模型可能会陷入有害行为,但实现这种转变的内部表示仍然很难本地化。最近的机械安全研究通常通过广泛的代表性对象来解释这种行为,包括全局拒绝方向、激活转向向量和拒绝相关的 SAE 特征。相反,我们询问越狱漏洞是否可以追溯到更细粒度的、提示条件的 SAE 功能子组。我们引入了一种词元驱动的机械管道,它将 Gemma-2-2B 的残余流分解为稀疏自动编码器(SAE)特征,并识别与不安全行为相关的特征子组。使用 BeaverTails 中的单类别不安全示例来减少跨类别干扰,我们从对抗性响应中提取有害概念,并通过子空间相似性将它们与概念相关的提示标记对齐。然后,我们应用三种特征分组策略:基于集群、分层链接和单标记驱动,来识别所有 26 层的 SAE 特征子组。最后,我们放大每个子组中的主要特征,并使用标准化的危害性判断来评估生成的世代。单词元驱动的分组所达到的危害性与完全基于集群的分组相当,这表明单个有害提示词元足以本地化与漏洞相关的 SAE 功能子组,而无需依赖更广泛的集群级聚合。这些子组出现在早期和中后期层,其中更集中于中后期层,其中有针对性的转向暴露了特定的模型漏洞。总体而言,我们的结果表明,越狱敏感性可以追溯到稀疏的、词元本地化的 SAE 特征子组,补充了基于广泛对抗、拒绝或转向方向的先前描述。