论文
最后一个词元之前:诊断最终词元安全探测故障
Before the Last Token: Diagnosing Final-Token Safety Probe Failures
摘要
最终词元安全探针在提示预填充后监视单个隐藏状态,但越狱提示可能包含分布在早期用户词元表示中的探针可见的不安全证据,而该读数会错过这些证据。我们使用仅在三个指令调整的 LLM 中的干净有害和良性提示上进行训练的 SafeSwitch 式探针来研究这种预填充时间故障模式。这些探测器在干净的有害提示上实现了高召回率,但错过了许多越狱,并且可能对与安全相关的良性提示产生误报。子空间分析表明,错过的越狱与探针代表性子空间很难捕获的方向上的干净良性提示不同,并且增加探针瓶颈宽度并不能可靠地解决这种不匹配问题。 词元级 预填充分析表明,探测可见的不安全证据通常出现在序列的较早位置,但在最终词元读出时不会暴露,而词元位置上的天真最大池在安全提示上会过火。一个简单的 PCA-HMM 轨迹模型,仅在相同的干净分割上进行训练,可以从用户内容预填充轨迹中恢复许多最终词元缺失,而不会出现天真的词元池的灾难性误报行为,从而激发轨迹感知隐藏状态分析作为最终词元探测的诊断补充