技术实践
天猫以离线评测、链路埋点和结果指标度量AI编码
概述
天猫团队自 2025 年 11 月启动「后端全栈」试点,让后端工程师零前端基础通过 AI 独立完成中后台前端需求,为回答「投入产出到底如何」建立三层度量:质量指标走离线评测,用 60 个真实历史需求跑系统评测,模型 A 总分 84.9、模型 B 57.0,差距近 28 分,热力图定位差距主要在组件文档不完善的场景。 链路指标走在线埋点,追踪上下文「调用 → 命中 → 采纳」漏斗,知识库调用率稳定在 43.2%,四象限分析识别出被频繁召回但采纳率仅 20%~30% 的高频低效知识,逐一优化后关联采纳率从 18% 提升到 35%。结果指标以需求为单位计算 AI 参与覆盖率、Diff 级代码上线采纳率与 Token 成本,采纳率按同一 (repo_project, branch) 下所有 AI Diff 合并后与 Merge Commit Diff 比对(示例中 AI 新增 2 行、CR 新增 3 行、采纳 2 行,采纳率 66.67%)。