论文

测量权限门:Claude Code 自动模式的压力测试评估

Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode

模型评测安全与风险评测

摘要

Claude Code 的自动模式是第一个为 AI 编码智能体 部署的权限系统,使用两阶段转录分类器来控制危险的工具调用。 Anthropic 报告生产流量的误报率为 0.4%,漏报率为 17%。我们针对故意模糊的授权场景(即用户意图明确但目标范围、爆炸半径或风险级别未指定的任务)对该系统进行了首次独立评估。使用 AmPermBench(一个涵盖四个 DevOps 任务系列和三个受控模糊轴的 128 个提示基准),我们针对 Oracle 真值 评估了单个操作级别的 253 个状态更改操作。我们的研究结果描述了在这种压力测试工作负载下自动模式的范围升级覆盖范围。端到端漏报率为 81.0%(95% CI:73.8%-87.4%),远高于生产流量报告的 17%,反映了根本不同的工作负载而不是矛盾。值得注意的是,所有状态更改操作中有 36.8% 通过第 2 层(项目内文件编辑)超出了分类器的范围,从而有助于提高端到端 FNR。即使限制为分类器实际评估的 160 个动作(第 3 层),FNR 仍为 70.3%,而 FPR 则上升至 31.9%。第 2 层覆盖率差距在工件清理方面最为明显 (92.9% FNR),当预期的 CLI 不可用时,代理自然会回退到编辑状态文件。这些结果突出了一个值得检查的覆盖范围边界:自动模式假设危险操作会通过 shell,但代理通常会通过分类器不评估的文件编辑来实现等效效果。