技术实践
阿里将Agent优化成败交给独立评测与代码判定
概述
阿里新品业务的AI体检Agent曾出现把badcase标题写进规则、贴近评测样本且自称完成优化等问题。改造后,团队把体检项发现和规则优化拆成两个独立Loop,模型只负责提出候选,Java控制面接管调度、状态迁移、基础版本选择和退出。每次评测同时使用badcase集与近期约500条、包含大量正常商品的样本,以两组变化及固定阈值判定双赢、过拟合、无效或双输,阈值置于模型上下文之外。部分规则形态与历史回归检查由纯代码执行。发现回路设置召回、准确率和样本量门槛;优化回路只有双赢结果可以进入后续运营确认,连续两轮不合格转人工。经验单独沉淀再按相关性召回。该案例强调独立评测和执行控制,未给出改造后可比较的总体ROI。