技术实践

淘天以约定和双引擎评测构建高价率运营工作台

模型评测智能体系统AI 基础设施应用与实践Agent任务评测AI 开发与运维平台评测方法与指标模型能力评测行业应用

概述

淘天团队立项建设「高价率运营 AI 工作台」,把行业小二的高价播报、数据分发、同款校验、价格跟进、归因、日报等长链路工作沉淀为 16 个业务 Skill;采用「约定驱动 + AI 编排」架构,用 skills/、skill-data/、pinchbench-suite/ 标准化目录固化规范,以 Claude Code 作为编排器实现自然语言驱动的全流程自动化;评测侧建 14 个通用评测维度 + 各 Skill 专项 rubric + 216 条评测用例,由 auto-evaluation(评测大脑)与 pinchbench-eval(执行引擎)双引擎执行,评测集基于真实业务数据生成,金标采用结构化字段 + 自然语言描述的混合 reference_data。 评测体系演进到第三版后做了两件事:基于真实 empId 与 Skill 定义由 LLM 自动生成典型/边界/追问/格式/触发词/真实 Case 6 类评测用例,以及用 LLM Judge 按 rubric 逐维度二值打分替代人工对答案;单次评测从「5 小时人肉」变为「40 分钟无人值守」,Skill 改进反馈周期从周缩短到小时,人工标注占比明显下降。 团队在半自动阶段保留三处人工兜底:LLM 生成的 Case 需人工过一遍才能进 queries.json;每次评测结果必须人工抽查 10% 的 Case 检查 LLM Judge 明显误判(源于曾出现连续两轮「全绿」但线上同时段抱怨、复盘发现一类边界 Case 被全判错的事故);核心 Skill 上线前除分数过线外还须人工跑 3-5 个真实 empId 端到端体验。同时披露 LLM 给出的修改建议约 80% 不合格,Phase 4/5(指标蒸馏/Skill 蒸馏)建议采纳率不到 20%,仍靠人工兜底。