技术实践
得物用大模型评测员量化推荐体验指标
概述
得物推荐产研团队为量化新颖性、相关性等长期处于黑盒的发现性指标,建成得物推荐评测平台(Axis),用大模型评测能力替代人工审计:评测提示词被抽象为独立配置资产,产品同学可针对相关性、新颖性等维度在后台可视化界面独立调优并支持版本控制与热更新,标准调整后秒级同步、无需代码发布。平台底层解耦模型供应商、提供统一接入协议,业务同学可自由选择 Qwen3-Max 等不同量级模型作为评测员,并在系统配置中实时观测其并发能力、当前版本准确率以及与人工结论的一致性水位。 AI 辅助模式从相关性、新颖性等维度对推荐结果做 1 到 5 分动态打分并输出判定依据,评测员可通过双列视图对照商品详情定位异常。为解决复杂电商场景下的理解偏差,产品同学调整 Prompt 后可一键抓取历史真实 case 做小规模盲测,人工专家在双列视图中对 AI 打分与文本解释实时审计修正,形成「产品专家定义标准、AI 高频执行放大、人工漏斗式校验」闭环,使评测一致性在业务动态微调下稳定保持在 92% 以上。 数据报表实时输出有效发现率、精准推荐率、无效推荐率,评测记录按 L0 到 L4 分级下钻,产研可在小时级内掌握实验组与基线的水位差。上线初期平台已稳定支撑大量实验任务、1 组例行大盘以及多场友商对比评测,单周评测数据处理量达百万级别,评测反馈周期由过去等待一周的大盘例行数据缩短至小时级,支撑上线初期推荐策略高频迭代,并在同等百万级审计需求下相比传统人工模式节省 91% 的资源投入。