技术实践
淘天以LLM评判链路评测家居场景模型
概述
淘天团队为家居导购搭配 Agent 搭建了从数据到指标的闭环评测流水线,已在「放我家」智能导购 Agent 的搭配任务中落地(「放我家」为家装领域的 AI 智能导购应用)。体系由四模块构成:Benchmark 创建(按场景类型与难度等级组织样本,既代表线上真实分布也覆盖长尾与高难问题)、LLM 模拟人工评测(引入多个多模态大模型作为评审员,在统一评分规约下维度化判定打分,可多评审投票提升稳定性)、人工抽样验收(抽样复核 LLM 评审结果、计算准确率并分析误判类型,作为质量闸门)、自动化评测与报告产出(每次模型更新全量评测,自动汇总低分样本与失败模式)。 执行路径为:在 2D 与 3D 两条业务链路生成候选搭配结果。把用户需求与任务目标结构化为一级维度 4 项、二级维度 22 项的评测清单。评测模型结合图文输入对每个二级维度逐项判定给分。二级维度以 True/False 输出后按规则聚合到一级维度。最终输出可对比报表并做归因分析。准确率口径为从搭配评测集随机抽取 100 条样本做人工复核,准确率 =(评测维度总数 - 误判数)/ 评测维度总数 =(1927 - 156)/ 1927 = 91.90%。 156 条误判集中在尺寸、类目、房间结构、人群偏好、商品偏好、场景偏好六个维度。