论文
FashionMV:多视图时尚数据的产品级合成图像检索
FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data
摘要
合成图像检索 (CIR) 使用与修改文本配对的参考图像来检索目标图像。尽管进步很快,但所有现有方法和数据集都在图像级别运行——单个参考图像加上修改文本输入,单个目标图像输出——而真正的电子商务用户对从多个角度显示的产品进行推理。我们将这种不匹配称为视图不完整性,并正式定义了一个新的多视图 CIR 任务,该任务将标准 CIR 从图像级检索推广到产品级检索。为了支持这项任务,我们构建了 FashionMV,这是第一个用于产品级 CIR 的大规模多视图时尚数据集,包括 127K 产品、472K 多视图图像和超过 220K CIR 三元组,通过利用大型多模态模型的全自动管道构建。我们进一步提出了 ProCIR(产品级组合图像检索),这是一个基于多模态 大语言模型 构建的建模框架,采用三种互补机制——两阶段对话、基于图像描述的对齐和思想链指导——以及可选的监督 微调 (SFT) 阶段,该阶段在对比训练之前注入结构化产品知识。对三个时尚基准的 16 种配置进行系统消融表明:(1) 对齐是最关键的机制; (2)两阶段对话架构是有效对接的前提; (3)SFT和思想链作为部分冗余的知识注入路径。我们最好的 0.8B 参数模型优于所有基线,包括 10 倍大小的通用嵌入模型。数据集、模型和代码可在 https://github.com/yuandaxia2001/FashionMV 上公开获取。