论文
从转换到目标状态:重新思考零样本组合图像检索的查询表示
From Transformation to Target State: Rethinking Query Representation for Zero-Shot Composed Image Retrieval
摘要
组合图像检索(CIR)旨在从由参考图像和修改文本组成的查询中检索所需的目标图像。此任务表现出一种不寻常的表征不对称性:修改文本指定从参考状态的转换,而检索候选者则描述完成的目标状态。这会导致零样本方法的表示不匹配,这些方法直接使用面向转换的语言查询预训练的视觉语言空间。我们研究了这种不匹配,并将零样本组合图像检索重新表述为目标状态重建,然后进行检索。我们使用 ASAP-CIR 实例化这个公式,这是一个无需训练框架,它使用冻结的多模态大语言模型 (MLLM) 重建静态目标表示。该表示将多个整体描述与一组可变的重要性加权原子语义相结合,从而保留整体目标身份和细粒度的视觉约束。然后,检索集成了整体状态对齐、原子约束定位和校准的目标状态证据聚合。受控的纯文本诊断表明,目标端静态查询公式比动态组合查询公式实现更可靠的检索,特别是当必须抑制或转换源状态语义时。 FashionIQ、CIRR 和 CIRCO 上的实验进一步表征了这种表示原理的有效性和局限性,在多目标 CIRCO 基准上获得了最明显的收益。这些结果表明,在检索之前如何表示组合意图是一个相应的设计选择,与检索骨干模型本身的选择不同。
