论文

合规检测器在读什么?对激活探针与守护模型的审计

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

模型评测安全与风险评测

摘要

已部署语言模型中的法规合规监控正日益被实现为一项法律与审计控制,依据涵盖数据保护、医疗、金融监管和平台政策的成文规则检查模型输出。只有当检测器的判定依赖于所陈述的规则而非场景的表面特征时,这种监控才有意义。我们证明这一条件在当前类别的合规检测器中普遍失效,我们将这种失败称为规则盲视(rule blindness)。删除、置换或替换所适用的规则,对我们测试的每个守护模型和激活探针的检测精度都没有影响,包括一个能正确引用适用条款的策略条件化守护模型——但当该条款被换成其宽松对应条款时,其判定几乎不变。一个专门构建的基准将两条规则与两个场景交叉组合,使得单独任何一方都无法预测标签,证实了这一失败——这一设计是先前基准都未排除的——并表明逐步推理,而非我们测试的任何快速检测器,才能摆脱这种失败。大规模审计需要一个无需重训练的检测器,因此我们提出内部合规分数(Internal Compliance Score,ICS):一种免训练的激活读出,用十个标注对校准,通过单次投影打分。我们让ICS接受与其所审计守护模型同样严格的审视:预设的击败平凡基线的标准未达到,一个词袋模型与其汇总泛化完全一致。它仍然有用,因为它成本低廉,让我们能审计四个已部署守护模型、一个8B零样本判定器和十三个基准,并且在用于对候选响应排序时提高了机械验证的通过率,不过自适应白盒攻击会消除这一增益。我们发布反事实协议和交叉规则基准,以便在未来的探针和守护模型声明中检验规则盲视。

合规检测器在读什么?对激活探针与守护模型的审计:论文配图
图1:完整流程——从构建到评分再到决策。离线校准(左)在触及任何测试用例之前,在两个不相交的留出切片上拟合方向并校准锚层与阈值,形式化定义见对页。在线推理(中)只需一次前向传播、一次激活抽取和一次点积。决策阶段(右)对得分设阈值,或在有用时据此排序或路由。总成本为校准 2n 次前向传播、评分 1 次,全程无任何梯度步骤。因篇幅所限省略:每个被评分的臂(arm)还会对照预算匹配的零基线、词汇下限以及(如适用)预注册门槛进行检验。