论文

MulVec:用于 无需训练 零样本合成图像检索的细粒度角色感知匹配

MulVec: Fine-Grained Role-Aware Matching for Training-Free Zero-Shot Composed Image Retrieval

摘要

无需训练 零样本组合图像检索从参考图像和文本编辑中找到图库中的目标图像,而无需从特定于任务的图像三元组学习。现有方法通常将目标描述为一个整体,并将该描述与全局图像表示相匹配。这种全局匹配可以混合不同的语义线索并丢失细粒度的细节。我们提出了 MULVEC,一种角色感知方法,其编译器生成映射到四个检索角色的结构化查询记录:Global 描述完整目标,Desired 说明应出现的内容,Preserve 说明应保留的内容,Forbidden 说明应消失的内容。冻结编码器将查询映射到一个目标描述向量和特定于角色的探测向量,而每个候选者由一个全局视觉向量和一组局部视觉向量表示。然后,检索角色将这些共享证据用于各自的目的,并且其分数的固定加权总和在单个检索过程中对整个图库进行排名。在 CIRCO、CIRR 和 FashionIQ 以及三个主干尺度上,MULVEC 比最强的比较方法将 CIRCO mAP@5 提高了 23.0%,并在我们的比较中给出了最佳的 CIRR 和 FashionIQ 结果。