论文

FIRE-CIR:组合时尚图像检索的细粒度推理

FIRE-CIR: Fine-grained Reasoning for Composed Fashion Image Retrieval

模型推理推理策略与问题分解

摘要

组合图像检索(CIR)旨在检索描述经过文本描述修改的参考图像的目标图像。虽然最近的视觉语言模型 (VLM) 通过将图像和文本嵌入到共享空间中进行检索而实现了有希望的 CIR 性能,但它们通常无法推理出要保留什么和要更改什么。这种限制阻碍了可解释性并产生次优结果,特别是在时尚等细粒度领域。在本文中,我们介绍了 FIRE-CIR,这是一种为时尚 CIR 带来组合推理和可解释性的模型。 FIRE-CIR 不是仅仅依赖于嵌入相似性,而是执行问题驱动的视觉推理:它自动生成从修改文本派生的以属性为中心的视觉问题,并验证参考图像和候选图像中相应的视觉证据。为了训练这样的推理系统,我们自动构建了一个大规模的时尚特定视觉问答数据集,其中包含需要单图像或双图像分析的问题。在检索过程中,我们的模型利用这种明确的推理来重新排列候选结果,过滤掉与预期修改不一致的图像。 Fashion IQ 基准测试的实验结果表明,FIRE-CIR 在检索精度方面优于最先进的方法。它还为检索决策提供可解释的、属性级的见解。