技术实践

淘天为商品营销Agent建立分层评测与上线门禁

模型评测智能体系统应用与实践Agent任务评测基准与评测资源评测方法与指标模型能力评测鲁棒性、公平性与可信度评测结构化分析、预测与决策

概述

淘天团队面向商品营销场景(输入含商品效果数据、预算约束、historyBest 帕累托策略、实验桶/对照桶数据与人工运营规则,输出为补贴、投放、素材优化等策略配置)建了一套方法论:五层评测对象从 Prompt 约束、上下文/经验供给、工具执行、策略推理到业务效果逐层拆解,任一层不稳会让下游评测失去意义;评测方法按确定性分三层——规则层判字段合法与预算越界、LLM 评估器判策略调整方向合理性、A/B 实验层判真实业务效果;数据集按失败模式分三批建设(常规/回归/Bad Case 为基础,线上回流/对抗/红队/安全为边界与风险探测,另设 Judge 验证集),遵循比例由风险决定、持续保鲜、评估器自身也要做能力验证三条原则(某版 Rubric Judge 准确率测试集 86%→验证集 68%→泛化验证集 55%);四步质量归因把问题路由到 Prompt、知识、工程、模型或规则的正确优化通道并闭环回归;三阶段上线治理以准入、灰度放量(对照桶/实验桶/稳定性验证桶三桶并行区分策略问题与环境噪声)、线上监控与回流嵌入真实流程。场景侧反馈信号稀缺:每天 3 组对照实验、T+1 收集数据,半个月仅积累约 100 条偏好对。 团队放弃黑盒 Reward Model,改用可解释的 Rubric + LLM-as-Judge,并用 Auto Rubrics 自动生成规则:候选池经 Rule Miner 对比挖掘(每对偏好数据挖掘 5-15 条规则、语义去重)与数据模式分析 + 多轮采样(8 轮、temperature=0.9,产出 1500+ 条候选、语义去重压缩至约 44 条)两条互补路线构建。筛选层给出三套递进方案:双侧违反率验证(从 170+ 条原始规则筛出约 10 条强规则)、比较评估 + 位置交换一致性(把绝对判断改为「A 和 B 哪个违反更严重」,一致率从 46% 提升至 84%)、稳定性筛选 + 交叉验证贪心选择(200 次 Bootstrap 抽 70% 子样本统计选中频率,5-Fold 交叉验证选入)。三个系统性陷阱均有量化证据:位置偏差使训练准确率虚高 96% 而 50/50 分割验证仅 50%(与随机猜测无异),引入 A/B 位置随机化后回落到 69.3%;330 条候选中无一条选择频率超过 80%(最高频仅约 30-40%),加权贪心训练 78% 对交叉验证 56%、差距 22%;三个模型中 model A 一致率 16.7% 且投票准确率 50%,model B 一致率 80% 但投票准确率仅 55%(稳定地判错),model C 三轮一致时 100% 正确。最终按三轮一致且方向正确筛出 Golden Set 供 DPO 训练。 模型持续为大量商品产出营销策略并定期迭代,「策略收敛」指某商品策略已稳定跑出可信正向结果、可固定不再迭代。因单日数据不可信(同一商品同策略今日涨 20%、明日跌 15%)且样本量差异极大(长尾商品一周仅 2 单,少 1 单即 50% 跌幅),团队设计了层层过滤噪声的四层漏斗:Layer 1 量级过滤掉成交量/数据天数/对照基准低于门槛的样本,过滤约九成商品;Layer 2 时间一致性要求连续多天达标且方向一致,再过滤约八成;Layer 3 用贝叶斯收缩(数据天数越少评分越向行业均值靠拢)综合达标天数占比、波动程度、趋势方向三维打分,取头部少量样本;Layer 4 贪心组合验证从贡献最高的商品起逐个加入,每加入一个就验证组合后每天的指标是否仍全部达标,不达标则跳过,输出最终 Clean Set。该流程与 Rubric 筛选复用同一思路:先稳定性筛选、再贪心组合验证,宁可覆盖率低也不让不可信数据进入结论。