技术实践
美团以离线门控与在线观测建立Agent评测体系
概述
美团 Agent 评测团队把两年间在多个业务方打磨出的 Agent 评测做法体系化:以长程 Agent「商家经营分析 Agent(对应内部商家 Claw 类场景)」为贯穿样例,把完备评测体系概括为四个模块——离线评测(固定评测集与固定执行环境,作为模型升级、Prompt 调整、知识库更新、Skill 新增/下线等变更的回测门控,采用多次试验取 Pass@k、分层门禁并把回测嵌入 CI/CD)、在线评测与在线监控(AB、影子模式、巡检三种在线手段,以及 Skill/Tool 成功率与失败率、Token 消耗、单任务平均步数、任务类型分布等监控维度)、Case 挖掘与归因(线上反馈、监控指标、规则挖掘与随机采样四类来源,Good/Bad Case 分化沉淀为黄金集与挑战集/错题集,通过 Trace 日志逐层定位问题点)、Agent 观测基建(以 Trace SDK 与 Trace Plugin 记录模型调用输入输出与 Skill 调用,保证最小可归因)。 两条 Loop(Agent 迭代 Loop 与评测体系迭代 Loop)共享同一批线上真实样本,在 Case 挖掘与归因处咬合、在评测集处共享资产。文中明确这些做法来自评测团队在美团多个业务的实践、在各自场景被验证有效,同时说明迁移到新场景需结合业务特点调整。