得物以大模型语义增强重构商品搜索索引
概述
交易搜索团队把大模型的世界知识系统性引入索引构建,从五路扩展商品文本:视觉理解用 Qwen2.5-VL-7B-Instruct+LoRA SFT 从商品白底图抽取颜色、纹理、材质、设计细节与风格等属性,数据侧先以 NER 与归一化建结构化属性池,再调用 32B 大模型清洗掉非视觉属性,推理产出后经规则初筛并对高风险子集调用模型做二值化图文一致性判断;社区语料挖掘用 Qwen3-4B,按动态质量分与点赞评论等互动指标圈选高信息密度内容,并把单商品逐条解析改为一次批量解析动态页关联的 N 个商品、注入语料标题与话题标签上下文;长尾稀疏商品引入相关推荐 I2I 图谱,用 Qwen3-32B 基于转化表现好的相似商品结构化信息生成拓展词;详情页用 DeepSeek-OCR 提取图片文本再交 Qwen3 做信息抽取与规范化;并从线上曝光日志沉淀高频曝光且相关性 2 档的 Query-Item 对作为已验证锚点。所有标签汇入独立 tag_recall 召回域,可按来源与权重混合召回、单类问题可独立降级回滚,质量侧为模型过滤+规则过滤(互斥词库、NER 实体类型)+人工审核三层防线。 针对长尾 Query 的细粒度视觉意图(如“复古棕调跑鞋”“奶油风沙发”),团队采用“预训练 + 相关性/行为感知向量召回”两阶段框架:预训练基于全量商品图片-标题对齐数据,以开源多模态大模型表征为初始化参考,用 Chinese-CLIP 双塔做对比学习——图像侧 ViT-B/16 取中层特征、文本侧 RoBERTa-wwm 编码标题及 LLM 增强后的文本标签,映射到统一语义空间;召回阶段设计四塔结构,Query 侧文本编码器产出 Query Embedding,商品侧含文本塔、图像塔与融合两者的多模态塔,用 Cross Attention(文本/图像特征作 KV,互补模态或查询意图作 Q)深度融合出 MM Embedding,多任务联合优化对齐目标,并对难度更高的 Query-图像跨模态支路赋予更大损失权重(最终比例 20:1:1)。训练样本取线上相关性 2 档且曝光位置靠前的 Query-Item 对为基础正样本,逐步引入点击与成交行为,负样本用 Batch 内负采样+全局随机负采样并结合 Batch 内正样本间负例共享缓解 SSB;推理时以 Query 向量对全量商品多模态向量做 ANN 检索。 团队参考 HLLM 思想,以 Qwen3-0.6B 为共享基座构建三个功能解耦模块:Item LLM 作为“货”的载体,输入商品标题、品牌、类目及 LLM 扩展文本,序列尾部拼 [ITEM] 取隐状态作商品语义嵌入,使长尾与冷启商品也能借 LLM 世界知识获得稠密表征;Query LLM 作为“场”的载体,用特定 Prompt(如“请根据用户检索词将文本压缩成嵌入,以进行后续商品推荐”)把实时搜索词编码为向量,尾部 [QUERY] 取输出;User LLM 作为“人”的载体,以 Next-Item Prediction 为目标,输入 Query 表征与用户历史交互商品序列(历史商品向量由 Item LLM 离线/在线产出),取末端隐状态实现“实时意图+长期偏好”联合建模。训练时 Item 与 Query LLM 共享大部分参数、User LLM 独立参数,以真实点击的下一商品为正样本、随机采样为负样本,用 InfoNCE 端到端串行联合训练。在线上 Query LLM 实时产向量、User LLM 输出实时兴趣表征后,在 Item LLM 预构建的全量商品向量库做 ANN 召回;高频 Query 结果缓存复用,新用户或行为稀疏用户降级启用按 Query 维度离线挖掘的高转化商品候选序列兜底。 团队借鉴 Meta 的 HSTU 架构,把用户在得物 APP 内搜索、推荐、社区等全场景行为轨迹编码为含六类信息(谁、场景、时间、商品、行为、行为意图)的结构化 Token 流,以 Teacher Forcing 自回归训练,并对时间戳、行为类型、场景等非商品 Token 施加损失掩码,仅对 item_id 计算损失。对比传统 SASRec(Self-Attention + FFN),HSTU 在长序列与大规模候选集上做了高效注意力实现与时序感知位置编码等优化,离线 HitRate 显著更优;消融覆盖不同参数量、Embedding Dim 与序列长度,指标随规模与序列长度持续上升,初步验证搜索召回场景的 Scaling Law。面对千万级词表采用 Sampled Softmax,负样本融合流行度偏置校正、Batch 内负采样与难负样本挖掘。v2 以多模态预训练商品向量经 RQ-VAE 编码为层级语义离散序列再 Hash 成 SID Hash 替代原始 item_id,词表从千万级压至百万级、显存下降,模型 blocks 由 16 扩至 32;并借鉴 LLM Agent 思路把 Query 及品牌类目 side info 作为序列前缀提供全局意图约束,未登录商品取同 SPU 下其他 item embedding 均值兜底。 语义索引召回参考 UniDex,不再用原始 Term 而用 SID 建倒排:在 Query 与 Item 的 Encoder 输入中分别追加 M=3、N=8 个可学习 Token 得到多粒度语义向量,经降维投影、FSQ 量化(K=2 二进制量化,每个语义向量编码为 19 位二进制序列,转十进制后作倒排检索键)与升维还原;训练用 Max-Max Token Matching 保持离线与在线一致,损失为 InfoNCE + Matching(权重 0.3)+ 量化正则(权重 0.1),使“af1”与“空军一号”落入同一 SID 桶以跨越词汇鸿沟。统一生成式召回则先用 RQ-VAE 把融合视觉、文本、行为的商品向量逐层在独立 codebook 中量化为层次化整数序列(codebook 以首批数据 K-Means 聚类中心初始化,重构损失 + commitment loss + stop-gradient 联合更新),把亿级商品压缩到可控 SID 空间;再以 6 层 Encoder + 6 层 Decoder(Hidden Dim 256)自回归逐 Token 生成目标商品 SID 序列,输入融合 Query 分词 Token(最大长度 10)、用户画像静态特征与历史行为 SID 及经 MLP 融合的 Side Info。在线用 Beam Search(宽度 100)解码,配合两项优化后生成式召回的候选商品数量提升一个数量级。 团队把生成式能力从独立召回通道升级为召粗一体化引擎:以生成式模型为统一载体,把用户兴趣理解、候选商品生成与粗排阶段的排序倾向融入同一建模框架,模型不再只对已有候选打分,而是直接面向后链路目标产出高价值候选;落地动作包括唯一化 SID 映射、长期兴趣建模、模型 Scale-up 与独立队列链路重构。正文披露的扩容与实测数据:HSTU 参数量由 SASRec 级别扩展到 hstu 4.2B,UniDex hidden size 由 256 扩至 1024,SID 维度由 3D 升到 4D(0.04B → 0.5B),每步扩容都带来可预期的离线指标提升且线上收益与离线趋势一致;当前 Encoder-Decoder 模型参数量约 0.5B,生成式召粗模型的 MFU 约 17%,正文判断超过 80% 的算力消耗在等待、显存搬运等非计算环节,后续拟用 CUDA Graph 固化执行图、FlashDecoding、Continuous Batching 与 Padding 消除、计算通信重叠等手段优化。