技术实践

淘天以事件驱动和函数编排构建商品领域Agent

智能体系统上下文与知识AI 基础设施模型评测应用与实践检索增强知识库Agent 架构与控制循环Agent Harness智能体互操作协议推理服务数据基础设施向量数据库AI 开发与运维平台评测方法与指标模型能力评测行业应用MCP

概述

商品中心在商品理解业务中把大模型能力从早期 T+1 离线批处理升级为工程化的领域 Agent。框架选型上评估了集团内外多款智能体框架后,选择轻度耦合的 spring-ai-alibaba 以适配集团成熟 Java 生态,并在其上自研轻量 aiagentsdk,通过 @AIWorkflow、@AIAction、@AIFunction、@AIParameter、@AIResult 等注解与切面把所有 function 自动转换为高质量 MCP 工具,形成上层业务场景 workflow 编排层、下层统一能力供给层的两层结构,调用方式为 {Registry}.{DomainRegistry}.{FunctionClass}.{FunctionName} 链式调用。业务侧已在商品属性、卖点等核心场景落地,覆盖亿级在线商品,显著提升信息完整性、准确率与丰富性,并在搜索、详情等导购场景实现成交转化率正向提升;研发效能上新需求从开发、数据试跑到评测优化全流程压缩到 1 周/人。 团队把商品领域知识拆成显性事实、关联情景、隐性经验三层并分别建设生产链路。显性知识围绕「类目-属性元信息」整合商品 SKU 主数据、商品图片、外部素材(小红书笔记与用户评价)、原始商品属性、人工评测与运营配置五类数据源,一路走统计分析模块计算填写率、SKU 数量、PV 对等统计指标,另一路走 LLM 理解模块从图像与文本抽取属性、识别用户关注点并生成同义词与解释,再与人工校验结果汇成结构化元知识库,文本字段向量化后存入向量数据库供语义检索。情景知识方面,主配件场景从 bad case 结果集中归纳知识,当前已在 10 个类目的近 10000 条案例中总结出 53 条规则。隐性经验以场景化主观描述形式沉淀。知识服务对外提供 save 与 query/count/pageQuery 标准接口,底层采用 MySQL(强一致持久化)+ TisPlus(批量向量化与大规模 KV 存储)两层异构存储。 主搜 SKU 化背景下,商品存储模型复杂且迭代频繁,从商品行到 SKU 行的变更量从万/秒上升到数十万/秒,原有 saro/精卫「数据表+行变更」视角存在一次操作放大为多行变更、以及多表 JOIN 计算(同一事实会因字段单独变更触发两次 JOIN)的双重放大问题。团队升级 SKU 引擎架构,把 SKU 变更降维到商品事务维度,在精卫链路设计并实现基于商品 ID + 事务 ID 进行数据行变更聚合并转发的事务消息链路:精卫任务中只处理并发送下游关注字段(或模型)的事务消息,将秒级别最终要处理的事务量级降低了一个数量级;下游用 Java 应用消费消息并补全数据,落到以全局唯一 skuId 为主键的异构 SKU 数据表,直接 DUMP 到 saro 链路供搜索消费。该链路同时提供了实时 SKU 素材与商品基础信息变更驱动源,商品 Agent 已据此搭建多个业务场景的实时推理能力。 针对 AI 产出商品数据的质量、置信度与在离线一致性问题,工程与测试同学基于 agent 应用构建了一套可量化、可归因、可复现的属性摘要大模型自动化评测系统:实现新桶 vs 老桶召回属性商品的数量、排名等信息的 AB 对比评测;利用大模型做语义理解与打分,构建覆盖 V 值准确性、完整性、可读性、一致性等的多维度规则体系,可按评测场景配置打分规则集;并建设可持续的数据搜索与评测链路、评测归因可视化以支撑决策优化与结果可追溯,运营也可针对单品或线上 badcase 做定向实时评测。应用分层中另设 item-agent-evaluation-client,专注 agent 实例效果度量与 A/B 测试,形成「执行-评估-优化」闭环。