技术实践

Anthropic 以模型分类器重构 Claude Code 的自动审批防线

智能体系统Agent 动作执行与治理

概述

Anthropic 工程团队为 Claude Code 推出 auto mode,用基于模型的分类器自动接管部分权限审批,以缓解用户批准约 93% 权限提示造成的审批疲劳。方案是双层防护:输入层由服务端提示注入探针扫描工具输出,发现劫持企图即向上下文注入警告;输出层由运行在 Sonnet 4.6 上的转录分类器在动作执行前判定,先做单 token 快筛、命中再走思维链复核,且只读用户消息与工具调用、剥离助手文本,避免智能体用自己的说辞左右判定。管线按风险分层:安全工具白名单与项目内文件编辑直接放行,其余动作进入分类器;默认含 20 多条阻断规则,外加评估规则、用户意图、信任边界三个可定制槽位,子智能体交接两端另设分类器把关。在 1 万条真实流量、52 条真实过度积极动作与 1,000 条合成数据外泄任务上评估,端到端误报率从 8.5% 降到 0.4%,但对真实过度积极动作的漏报率为 17%。当会话累计 3 次连续或 20 次总拦截时,系统停止执行并升级给人工。官方同时明确适用边界:它不是高风险基础设施上逐项人工审查的替代品。