已部署安全分类器的在线移位检测和保形适应
Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers
摘要
部署为安全监视器的推理模型存在系统漏洞:推理-词元预算 饥饿。对抗性输入需要比良性输入多 $3.3\times$ 的推理词元才能产生有效的安全分数(o3 的 $T_{50,\text{adv}}{=}154$ 对比 $T_{50,\text{benign}}{=}46$),因此低预算部署会悄悄地让监视器缺乏它必须捕获的输入。这加剧了中心故障模式:基于梯度的规避仍然是残余威胁 - 模板越狱失败率为 99%,但 GCG 优化的后缀可靠地翻转编码器决策。我们将金丝雀结构系统化——目标分类器和非目标分类器之间的分数不一致监控——并量化其在目标规避下的可靠性。我们得出精确的安全边界 - 一个置信门控平衡,在该平衡处,监控感知的攻击者会停止(验证间隙 $= 1/(2λ)$,在理论的 95% CI 内) - 并识别后移保形适应中的故障模式。三贡献。 (1) 阶乘漂移基准。预先注册的 800 个单元评估($4$ 分类器 $\times$ $5$ 移位类型 $\times$ $20$ 种子 $\times$ $2$ 窗口)显示检测难度主要由分类器 $\times$shift 交互决定($η^2 = 0.185$):编码器在 28 个步骤中检测到释义漂移,但在 37 个步骤中错过了对抗性后缀;解码器显示相反的情况。 (2) 生成嵌入中的共形崩溃。加权共形预测在解码器分类器上失败:逻辑密度比估计在 3584--4096 维空间中实现完美的可分离性,将所有重要性权重修剪为零。投影到 $\leq$32 维度可恢复覆盖范围 (+33pp)。 (3)对抗性金丝雀威胁模型。在 35 个前沿模型中,4 层威胁模型可提供部署保证($\geq$71% 检测,$N{=}1000$ 时 $<$1.5% FPR)。