论文

超越攻击成功率:LLM安全失败的时序Logit可观测性

Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures

模型评测安全与风险评测

摘要

攻击成功率(ASR)在生成结束时用单一的是/否标签评估每次越狱,只告诉我们失败是否发生,却不说明它是如何展开的。产生同等有害输出的两次攻击可能走过完全不同的路径,而ASR无法区分它们。我们让这些隐藏路径仅凭logits即可被观测。时序Logit可观测性(TLO)是一种免训练诊断方法,它在解码过程中监测服从-拒绝边距,并将每个模型-攻击条件置于一个经校准的二维平面上。就设计而言,这一平面恰好在ASR信息量最小之处最具信息量:即在因真正不同的原因而成功的攻击之间。在四个对齐LLM和三种越狱范式上,ASR几乎相同的攻击落在平面上明显不同的位置:同一模型可能经由不同的时间模式而失败。在大多数条件下,该几何结构与来自隐藏状态的拒绝方向探测结果一致,其中一个模型显示了固定词表方法的局限。由TLO导出的简单提前停止规则将成功越狱削减一半以上,且对普通良性查询不产生误报。安全评估应报告失败于何时、以何种方式展开,而不仅是是否发生。TLO使前两者仅凭logits即可被观测。

超越攻击成功率:LLM安全失败的时序Logit可观测性:论文配图
图 1:ASR 崩溃了暂时不同的安全故障。 (a) 针对同一有害问题的不同攻击可以产生同样合规的最终响应,在 ASR 下无法区分。 (b) 模型攻击条件遵循时间上不同的 logit 轨迹,可恢复为 TLO 的每步合规性拒绝裕度。