技术实践
阿里营销团队用编码Harness评测业务Agent
概述
某业务系统内容生成链路由图片理解、内容审核、文案生成、风格匹配等多个子 Agent 协作完成,prompt 天级迭代但传统评测工程周级搭建。团队改用顶级 Agent(Claude Code)作为 Harness 的搭建者与运行者:CC 扮演方案架构师,从一个 prompt 文件到完整评测方案约 10 分钟交互。 扮演数据工程师,写脚本调用业务接口拉数并打包成带 system.question 列(内含输入字段与 ground_truth)的评测集 Excel。扮演 Harness 工程师,把传统数百行评测脚本改写为评测 Agent 提示词,由评测 Agent 调被测 Agent、做硬规则检查与 LLM-as-Judge 打分并输出结构化 JSON。 跑批后由 CC 读取结果做统计、归因与跨版本对比并出报告。评测 6 个 Agent 后沉淀三层指标框架:L1 通用基础指标(输出格式合规率、字段完整率)、L2 按能力类型选用(分类准确率、召回/精确率、精确匹配率、MAE+分档一致率、LLM-as-Judge 1-5 分)、L3 Agent 专属指标(如违禁词清洁率)。 实测单 Agent 全流程从约 1.5 周压缩到 1-2 天(约 5x),方案设计 10-30 分钟、评测集构建半天、评测 Agent 开发 1-2 小时。跑批示例 50 条中格式合规率 92%、过滤 Recall 100% / Precision 18.2%,CC 归因出「把评分维度误用为过滤条件」并给出 prompt 修改建议。