论文

从探针分数到警报策略:语言模型智能体激活监视器的操作有效性

From Probe Scores to Alarm Policies: Operational Validity of Activation Monitors for Language-Model Agents

模型评测评测方法与指标

摘要

激活探针可以预测接收器操作特性曲线 (AUROC) 下面积较大的语言模型的安全相关属性,但部署的智能体监视器在紧张的误报预算下做出阈值警报决策。这些是不同的估计值。我们引入了操作有效性合同,它确定了监测器的目标、可观察性、身份、计时、干预单元、比较器、校准和成本。我们在语义请求或轨迹级别将风险形式化:当一项任务包含重复警报机会时,行级 AUROC 和误报率不会识别语义单元任何警报风险。经过置信度认证的阈值还需要足够的独立负单元、安全绑定规则以及部署运输。在压力下的模型、LASR 拒绝预测、不可变的 AgentDojo 和前瞻性协议冻结的 ST-WebAgentBench 复制中,联合激活可观察监视器在前两个基准测试中达到 AUROC 0.957 和 0.935,但其锁定的 5%/10% 检测率分别仅为 0.642/.742 和 0.719/.782。在 AgentDojo 上,辅助平均激活执行轨迹监视器达到 AUROC 0.922,但在锁定的 5% 操作点上没有检测到 38 个积极语义案例; 10% 误报阈值在测试中实现了 18.7-20.0%。由于该测试错过了预期冻结的 40 阳性支持门,因此我们将其标记为支持不足。在 ST-WebAgentBench 上,激活达到 AUROC .874,但 23 个独立校准负值甚至无法识别 10% 的控制器;锁定的策略弃权而不是报告其机械零 FPR 成功。探索性反例还降低了全部 AUROC,同时提高了 10% 的实现效用。故障关闭编译器将 MUP 和 LASR 限制在预测值上,将 AgentDojo 和 ST-Web 限制在表示可访问性上;没有设置达到警报-策略的有效性。