技术实践

美团用二元化Rubric建立业务Agent评测

模型评测智能体系统AI 基础设施Agent任务评测可观测性基准与评测资源评测方法与指标长程任务评测

概述

美团图灵 Agent 评测团队在两年实践、深度 BP 公司各业务团队的过程中沉淀出一套 Agent 评测方法论并落地到具体业务。核心是「人人对齐和人机对齐」:人人对齐即由一位强有力的「独裁者」拉齐产品、运营、研发、QA 的评测标准、遵循同一套体系,评测员用背靠背标注对齐。人机对齐要求机器评测结果与人工评测结果一致,否则不置信,以支撑规模化提效。 做法是先把大而模糊的指标下钻成更细的评测 Rubric(与开源项目 Arize AI 的口径对齐),再把每条 Rubric 尽量二元化为是/否/未知,用 unknown 占比反查 Rubric 定义是否合理,直到人人一致率、人机一致率达到 85%、90% 等可信阈值。执行上按采集、清洗、评测、质检、分析归因五个环节与线上 AB、持续观测构成数据飞轮,起步优先「让数据飞轮高效运转」而非设计复杂指标体系。 效果:履约数字站长业务项目启动时只有 20 多个评测指标,经历 1 年推全后扩展到近 200 个,人机一致率可达 99%。Beam 以图灵的二元化方案改造评测体系后,人机一致率从 62% 提升到 92%。文中另指出员工侧观察到的三类需求:商家侧仍在探索和试点阶段、公司内部 AI at Work 系统中长程 Agent 融合更广并覆盖产运研销多类角色、Skill 开发门槛越来越低甚至可由 AI 辅助生成。