有害传播动力学:大型语言模型中对抗意图的分层轨迹
Harmfulness Propagation Dynamics: Layer-wise Trajectories of Adversarial Intent in Large Language Models
摘要
我们确定了有害传播动力学(HPD):对于有害提示,最后一个标记隐藏状态在学习到的危害方向上的投影随着Transformer深度单调上升,而良性提示则保持平坦或振荡。这种跨层签名将有害意图反映为\emph{渐进解析}语义属性:表面形式出现较早,而实用意图随后巩固,使得\emph{轨迹形状}比任何单层快照提供更多信息。此外,每层学习的基于 LDA 的伤害方向在随机分割中保持稳定(成对余弦相似度 $>0.97$),支持将投影序列作为可再现的结构化信号。在 HPD 的基础上,我们引入了 \textbf{\herald{}} (\textbf{H}armful \textbf{E}ncoding \textbf{R}ecognition via \textbf{A}activation \textbf{L}ayer \textbf{D}dynamics)。这个轻量级输入调节器从跨层投影序列中提取七维特征记录、斜率、曲率、单调性、起始层和相关统计数据,并使用 288 参数 MLP 对其进行分类。 \herald{} 每层存储一个 $d$ 维方向(32 层 $262$\,KB,$d{=}4096$ 模型),在训练期间不需要梯度计算,并且在推理时仅添加 $2.6{\times}10^{-6}$ 预填充 FLOP。在八个即时危害性基准和四个模型系列中,\herald{} 在 OLMo2-7B 上实现了 89.3 美元的平均 F1,超过了所有在对抗性越狱检测上测试的防护模型(98.4 美元 vs.\ 96.9 美元 F1),并且在每个骨干网上比之前基于潜在的方法的 F1 点高出 2.3 美元-4.1 美元。每个实例的轨迹提供了机器可读的审计记录,揭示了有害性何时出现以及如何出现,与单层方法相比具有可解释性优势。