论文
当解释背叛后门时:语言模型分类器的黑盒审计
When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers
摘要
带有解释的语言模型分类器用于调节、路由、主题分类和低资源注释。当防御者只有干净的校准数据而没有触发信息但可以要求分类器提供标签以及简短的理由或引用的证据时,我们研究黑盒审计。我们引入了 Groundedness Drift,这是一个轻量级分数,用于衡量答案摘要是否仍然基于输入。在两个 7B 主干网、五个数据集和四个常见的非自适应 OpenBackdoor 式攻击系列中,Groundedness Drift 在所有情况下以名义上 5% 的 clean-FPR 预算实现了比每个比较检测器更高的 AUROC 和更低的残留目标 ASR。然后,我们评估无支持的依据一致性,这是一种针对解释伪装压力案例的多探针升级。不支持的依据一致性可以改善信号,但不会缩小自适应差距。