论文
作为 LLM 残余流的几何可恢复特征的有害意图
Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams
摘要
对齐的语言模型拒绝有害的指令,但它们识别这些指令的表征不如它们产生的行为那么好。有害意图与跨越四个架构系列(Qwen2.5、Qwen3.5、Llama-3.2、Gemma-3)和三个对齐变体(基础、指令调整、消除)的 12 个模型的残余流激活线性分离,参数范围从 0.5B 到 1.3B,Qwen3.5 上的范围内范围扩展到 9B。通过 Soft-AUC 优化从每类 100 个标记示例拟合的方向达到平均有效 AUROC 0.982 和 TPR@1\%FPR 0.797,概括为三个保留的伤害基准和硬良性控制,并在删除了拒绝机制的取消变体中与 $\pm 0.003$ AUROC 内的指令调整对应项相匹配。监督策略均超过 AUROC 0.96,但其 TPR@1\%FPR 相差 AUROC 差距十倍以上;部署的 9B 安全分类器在 AUROC 0.94 和 TPR 0.30 上显示出相同的模式,促使低 FPR 报告成为安全邻近检测评估中的默认值。几何测量完善了图片。恢复的方向集中在每个提取协议内,但在它们之间依赖于协议:两个池化选择应用于同一残差流层上的相同聊天模板激活(内容词元上的最大池与指令后位置的最后一个词元)恢复伤害方向相距$73^\circ$,并且投影一个出来使任一最大池提取下的检测基本上完好无损。探测识别特定于协议的方向而不是独特的计算特征。