论文

潜在的潜流:普通的拼写错误如何破坏探针

Latent Undertow: How Ordinary Typos Break Probes

模型评测安全与风险评测

摘要

大语言模型可以流畅地处理普通的打字变化:拼写错误或缺少标点符号会使用户意图和模型的响应实质上保持不变。然而,通过读取模型的隐藏状态来检测恶意提示的探针却讲述了一个不同的故事:相同的编辑在扰动的标记处将读出向量旋转 43--56,在大约 10 个下游标记内衰减到 15% 以下。每条消息堆叠约 3 个常见拼写错误会将单位置提示注入探针的 TPR@FPR$=1% 减少 12.0pp,仅靠重新校准无法弥补差距。多位置聚合可以解决局部扰动(<= 0.5 损失),但只会减弱分布式扰动,即使是基于注意力和最大值的聚合器仍然会下降约 3.8pp。对于单位置探针,我们引入了一个 KV 缓存叉:在用户消息后附加一个短的固定后缀,让探针能够利用其快速空间衰减来读取扰动下游的一些标记。这缩小了 95% 的差距(-0.6pp 残差)——比扰动增强训练(-3.7pp)好一个数量级。旋转和衰变几何在 Llama-3.1-8B、Qwen3-8B 和 Gemma-4-E4B 上复制;探测器评估在 Llama-3.1-8B 上进行。代码:https://github.com/eladd-ai/latent-undertow