技术实践

淘天以多基座横评定位场景模型能力瓶颈

智能体系统模型评测应用与实践Agent任务评测模型能力评测行业应用

概述

淘天团队用四种搭配模型(外部模型XX、gemini25、gpt51、qwen3-vl)在 2D 与 3D 业务链路生成搭配结果,再用同样的四种模型作为评测模型对全部结果独立评分(每条样本多次评估取平均),准确率按与人工标注 GT 对比、以 [0,1] 区间呈现。结果:gpt51 总分 0.680 排名第一(基础指令 0.692、专业指令 0.799、补充指令 0.668、用户画像 0.560),gemini25 0.674 与外部模型XX 0.666 为第二梯队,qwen3-vl 0.584 四维均最低。 相较当前线上方案 qwen3-vl,最优基座 gpt51 总分提升 16.4%。评测模型一致性以各模型评分与四模型平均基准分的 PLCC 相关性衡量:gemini25 0.962 > gpt51 0.931 > qwen3_vl 0.925 > 外部模型XX 0.896,gemini25 被选为最稳定的自动化评审模型。 对全部 960 条样本做问题聚合后识别出三类共性瓶颈:无法识别已有家具导致重复推荐(频率最高)、未抓住用户核心需求导致跑题、推荐过量无关商品导致输出过度。