论文
藏于平实文本之中:通过激活解缠检测隐蔽越狱
Hiding in Plain Text: Detecting Concealed Jailbreaks via Activation Disentanglement
摘要
大语言模型(LLM)仍然容易受到流畅且语义连贯的越狱提示的攻击,这类提示难以用常规启发式方法检测。一种特别棘手的失效模式是攻击者通过操纵请求的措辞框架来诱导顺从,从而隐藏其恶意目标。由于此类攻击通过灵活的表达方式保持恶意意图,依赖结构性痕迹或特定目标签名的防御可能失效。受此启发,我们引入一个自监督框架,在推理时对 LLM 激活中的语义因子对进行解缠。我们针对目标与措辞框架实例化该框架,并构建 GoalFrameBench,一个具有受控目标与措辞框架变化的提示语料库,用于训练 Representation Disentanglement on Activations(ReDAct)模块,以在冻结的 LLM 中提取解缠表征。随后我们提出 FrameShield,一个作用于措辞框架表征的异常检测器,它以极小的计算开销在多个 LLM 系列上改进了与模型无关的检测。ReDAct 的理论保证与大量实证验证表明,其解缠有效支撑了 FrameShield。最后,我们将解缠用作可解释性探针,揭示了目标信号与措辞框架信号的不同特征,并将语义解缠定位为 LLM 安全与机制可解释性的构建模块。
