有害意图的几何:通过 LLM 残余流中的角度偏差进行 无需训练 异常检测
The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams
摘要
我们提出 LatentBiopsy,这是一种 无需训练 方法,通过分析 大语言模型 中残余流激活的几何形状来检测有害提示。给定 200 个安全规范提示,LatentBiopsy 计算其在目标层激活的主要主成分,并通过其与该参考方向的径向偏差角 $θ$ 来表征新提示。异常分数是在高斯拟合正态分布的情况下 $θ$ 的负对数似然,无论方向如何,对称地标记偏差。训练不需要有害的例子。我们评估了 Qwen3.5-0.8B 和 Qwen2.5-0.5B 系列的两个完整模型三元组:基础、指令调整和 \emph{abliterated}(通过正交化手术去除拒绝方向)。在所有六个变体中,LatentBiopsy 在有害与规范检测方面实现了 AUROC $\geq$0.937,在区分有害和良性攻击性提示 (XSTest) 方面实现了 AUROC = 1.000,每个查询的开销为亚毫秒级。出现了三个实证结果。首先,几何结构在拒绝消融中幸存下来:两个被消除的变体的 AUROC 最多比其指令调整的对应版本低 0.015,从而在有害意图表示和下游生成拒绝机制之间建立了几何分离。其次,有害提示表现出近乎退化的角度分布($σ_θ\approx 0.03$ rad),比标准分布($σ_θ\approx 0.27$ rad)更严格一个数量级,在包括消除在内的所有对齐阶段都保留。第三,两个家族在相同深度表现出相反的环方向:有害提示在Qwen3.5-0.8B中占据外环,但在Qwen2.5-0.5B中占据内环,直接激发方向不可知的评分规则。