技术实践
阿里商品中心将Agent评测拆到感知、规划、记忆和工具
概述
阿里全球化商品中心IC团队将Agent评测按感知、规划、记忆和工具四个模块拆解,避免综合分掩盖相互抵消的改善与退化。体系覆盖基础技能、知识问答、多轮对话、异常输入、工具调用、多意图、模糊意图和长对话衰减八类数据,设置十一项端到端指标和二十四项模块指标,并埋点记录模型及工具调用、Token和模块延迟。质量评分通过六类结构化LLM裁判任务执行,支持Mock与Real两种模式,路由错误时跳过不适用的下游指标。平台已从单Agent看板扩展为团队内可配置的评测基础设施,以质量、成本和性能看板及用例下钻支持日常回归。