论文
探索用于时尚图像检索的多模态 大语言模型 和两阶段 微调
Exploring Multi-Modal Large Language Models and Two-Stage Fine-Tuning for Fashion Image Retrieval
摘要
组合图像检索使用参考图像和修改后的文本描述的组合查询来检索目标图像。在时尚领域,这项任务需要理解微妙的属性变化,例如颜色、图案和纹理。然而,由于注释数据稀缺和负采样过于简单,现有方法面临局限性。我们提出了一种新颖的框架,该框架集成了多模态 大语言模型 (LLaVA)来生成属性感知三元组,并引入了两阶段 微调 策略来增强对比学习。我们利用预训练的视觉语言模型(例如 CLIP-ViT/B32)来生成句子级提示并将其与相对图像描述连接起来,并使用静态表示来缩放负样本的数量。实验结果表明增强的构图推理和改进的细粒度检索行为,强调了所提出的时尚检索框架的可行性和潜力。