论文

中间层知道什么:从熵动力学检测越狱

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

模型评测安全与风险评测

摘要

越狱攻击揭示了对齐的 大语言模型 中的一个持续弱点:尽管经过安全训练,精心设计的提示仍可能引发违反策略的响应。虽然大多数防御在提示或输出级别上运行,但仍不清楚有害意图是如何在模型的内部表示中编码的。我们通过使用 logits 透镜分析冻结 LLM 各层的 词元级 预测熵轨迹来研究这个问题。我们发现提示级熵(例如均值、方差)的静态聚合统计数据几乎不带有区分性信号,而捕获熵如何在词元位置上演变的特征(例如基于单调排名的趋势分数)则提供更多信息。重要的是,该信号在模型深度上并不均匀:它集中在中间层并在最后一层退化,这表明越狱相关结构在中间网络表示中最明显,而不是在输出头。在多个模型(Llama、Qwen、Gemma)和对抗性基准中,这些熵动力学提供了架构一致的分离,无需额外的训练。总之,我们的研究结果表明,越狱行为反映在结构化的中间不确定性动态中,阐明了哪些熵衍生特征编码了有害意图,以及网络中该信号最明显的位置。