技术实践

天猫以结果与行为双视角评测复杂编码任务

模型评测智能体系统应用与实践智能体互操作协议Agent任务评测评测方法与指标模型能力评测编程MCP

概述

与 SWE-bench 等只看结果的 Benchmark 不同,团队采用「结果 + 过程」双视角评分:结果分(75%)评估代码是否满足业务需求,由 LLM as Judge 按 refAnswers 关键点逐一给 0/0.5/1 三档,有测试覆盖的场景再用 testCases 加权融合。行为分(25%)评估 Agent 是否遵循合理流程(是否调用知识库 MCP、是否查阅文档),权重经 80/20、70/30、75/25 三种配置对比后选定 75/25,用于区分「碰巧正确」与「稳定正确」。 评测用例按业务复杂度(L1-L3)× 组件成熟度(C1-C3)矩阵组织,红色区(L2-C3、L3-C2、L3-C3)判定超出 AI 有效辅助边界并用于需求分流。调优案例:L2-C2 象限(有联动 + 组件文档不完善)早期仅 55 分,定位到「表单联动」类需求后通过增加联动规则表与流程图优化 SPEC 模板、优化 Prompt、补充知识库,提升到 70 分。 可信度保障包括人工抽检(LLM 评分与人工复核一致性 > 90%)、多模型交叉验证、版本基线对比与轨迹存档复盘。