技术实践
阿里代码安全团队以评测驱动闭环自动迭代审计Agent的Skill
概述
作者是一名代码安全工程师,用Agent审计漏洞时手改Skill像打地鼠:修好一个case又弄坏别的。他把改Skill做成可重复的自动进化流程,前提是输出能客观判对错。评测侧自建sec-code-bench平台,把人工标注case经OpenAPI派发到与日常一致的真实环境,LLM judge比对结论算出TP/FP/TN/FN,导出结果与日志喂给进化。trace_parser把几十万token的session压缩约100:1;flow_diagnosis用8条确定性规则联合归因,同根因覆盖至少30%失败case才触发;patch_engine只让LLM生成80行以内diff,过taboo、结构与反口号过滤,再经target、guardrail、holdout、verify四层门禁才入库,被拒改动进共享黑名单;版本以软链快照管理。在63例营销漏洞评测集上,进化后GLM从77.8%升至88.9%、Kimi升至84.1%、DeepSeek升至87.3%,为作者自测。系统只能优化方法论、不能补工具能力缺口,规则诊断覆盖不了纯认知错误;作者还发现「漏洞」换成「风险」一词会让准确率掉27个百分点。