论文

激活监视器能否在模型更新后继续存在?基准测试、预测和修复激活监视器陈旧性

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness

模型评测模型行为与机制分析

摘要

激活监视器——在语言模型的内部表示上训练的轻量级探针——是部署安全堆栈中越来越常见的层。然而,部署的模型很少是静态的:它们被量化、微调、使用 LoRA 进行调整,或者在监视器保持冻结状态时使用合并的适配器提供服务。我们对这种隐式契约是否成立提出了第一个系统测试:在这些常规模型更新后,在基本模型上训练的激活监视器是否仍然可靠。在多个安全相关的监视器、模型深度、更新系列和开放权重模型中,我们发现了一个尖锐的分歧:量化式更新在很大程度上保留了冻结的探针性能,而 微调 式更新经常使探针过时。脆弱性高度依赖于监控器,隐私/PII 探测器受影响最大,拒绝合规性探测器相对稳定,这表明重新训练行为不需要使其相应的监控器失效。尽管 NF4 量化本身相对良性,但 QLoRA 的破坏性尤其大,这表明量化与适应相结合时风险更大。我们进一步表明,从部署前的功能中可以预测降级,从而使重新验证预算能够针对最有可能失败的监视器进行分类。最后,我们测试了修复策略,发现廉价的无标签激活重排可以修复每个与修复相关的陈旧细胞,不需要分数校准、少标签头或标记再训练。这些结果表明,微调 应默认触发激活监视器重新验证,并使用预测分类(首先监视检查)和无标签重新对齐作为默认修复。