用于大规模电子商务视觉搜索的分级相关性组合多模态检索
Graded-Relevance Composed Multimodal Retrieval for E-commerce Visual Search at Scale
摘要
大型电子商务目录上的视觉搜索必须同时提供“相似性”查询和“修饰符”查询,“相似性”查询要求与上传图像类似的项目,“修饰符”查询包括描述所需修改(例如颜色更改或样式交换)的图像和文本。后者是称为组合图像检索 (CIR) 的设置。然而,现有的 CIR 方法将相关性视为二元,并在具有单个正目标的三元组上进行训练 - 不太适合真实的目录,其中许多候选者部分满足用户查询,并且在部分匹配范围内进行排名驱动客户体验。我们提出了一种在分级相关性上训练 CIR 检索器的方法,包括:(i) 用于管理训练数据的 VLM,生成查询(对象检测 + 修饰符合成)和 4 级相关性标签,无需手动注释;(ii) 迭代相关性反馈循环,通过从训练中的检索器中挖掘硬负例来扩展训练集;(iii) 层次感知的角度目标,直接在分级标签上训练检索器,而不是将其折叠为二进制分裂。我们将这种方法称为 GradCIR,并在 PaliGemma2 双编码器上实例化它,该编码器使用原始沃尔玛目录数据中的 350 万个分级对进行训练。受控的分级与二元消融隔离了监督粒度,并在 NDCG@10 中显示出 4.9%-5.9% 的提升。应用于其他多模态编码器的相同方法可将早期融合主干提升高达 8.5% NDCG@10。在公共 FashionIQ 基准上,GradCIR(应用于 PaliGemma2)经过微调后平均召回率达到 0.6703,略高于我们比较的最强同行评审监督基线,并且匹配或超过所有已发布的 CLIP-L 级零样本 CIR 方法。该系统部署在沃尔玛的生产环境中,为实时视觉搜索用户流量提供服务。