论文

评测整个防护栈:规则门与 LLM 门是否独立失败?

Evaluate the Stack, Not the Layer: Do Deterministic and LLM Gates for Agent Actions Fail Independently?

模型评测安全与风险评测

摘要

智能体工具调用 的运行时门是基于其错误成倍增加的假设而堆叠的。我们在来自三个语料库的 1,119 个标记为智能体的操作上对其进行了测试,没有自适应对手。该堆栈具有一个确定性规则层和四个 LLM 判断器,其中三个会重新收集,并在每次调用时记录所服务的模型。我们将每个堆栈视为多个乘法等效层 n_mult,其底层处于完美耦合状态。根据 STRICT 未命中定义(升级到人类得分为未停止),任何两个判断者组成约 1.2 至 1.4 层(φ 中值 +0.430,6 对中的 6 个显着,楼层 1.02 至 1.17)。规则层加上一位判断者组成1.86至2.09层(φ中值+0.014,4个有效值中的0,层1.01至1.09)。在 PRIMARY(已捕获的升级评分)下,范围为 1.21 至 1.57 和 1.80 至 2.13。汇总数据上的间隔是分开的,每个语料库上的点估计是分开的,并且第三供应商的评委落在评委带上。单独的准确性并不能预测层添加的内容:云规则包可将规则层的单独错过率降低 20%,并且不会添加新的联合覆盖范围。判断耦合的难度份额无法识别:31.8% 到 61.8%,具体取决于 探针 和未命中的定义。 112 批中的 50 批中的 50 批为一级评委提供了服务,主要集中在外部语料库。该事件推翻了预先宣布的分析规则,审查裁决的评分推翻了五个结论。我们都报告了。