论文
所有 LLM 都知道自己何时有害吗?跨模型系列的潜在空间安全探针的再现性研究
Do All LLMs Know When They're Being Harmful? A Reproducibility Study of Latent-Space Safety Probes Across Model Families
摘要
卡特里等人。 (2026) [DOI: 10.1109/DSN-W70714.2026.00027] 表明,在单个 8B 模型 (LLaMA-3.1-8B) 的最后层激活上的轻量级 MLP 探针检测到 F1 上的有害提示,与大 1000 倍的防护模型相媲美,每个基准测试使用一个探针。我们端到端地重现了这条管道,并沿着原始研究留下的两个轴延伸它。首先,我们使用三个基准(WildJailbreak、BeaverTails、AEGIS 2.0),通过 Gemma-4-E4B、Mistral-7B-v0.3 和 Qwen2-7B 等模型的激活训练相同的探针,来测试结果是否可以推广到其他模型架构和规模。其次,我们通过在五个随机种子下重复提取并测量 F1 分数的方差来测试推理期间报告的性能有多少受到非确定性的影响。我们的结果再现了原始 LLaMA 模型基准,误差在原始 F1 分数的 0.37 个百分点以内(BeaverTails 上的误差在 0.2 个百分点以内)。我们发现原始 MLP 探针架构扩展到其他模型系列,其 F1 分数与 LLaMA-3.1-8B 报告的值相差一个点。我们改变种子值的实验揭示了一个有趣的观察:对于所有测试的架构,最终的词元潜在向量保持相同,无论使用的种子值如何。