论文

从转换到目标状态:重新思考零样本组合图像检索的查询表示

From Transformation to Target State: Rethinking Query Representation for Zero-Shot Composed Image Retrieval

上下文与知识检索增强

摘要

组合图像检索(CIR)旨在从由参考图像和修改文本组成的查询中检索所需的目标图像。此任务表现出一种不寻常的表征不对称性:修改文本指定从参考状态的转换,而检索候选者则描述完成的目标状态。这会导致零样本方法的表示不匹配,这些方法直接使用面向转换的语言查询预训练的视觉语言空间。我们研究了这种不匹配,并将零样本组合图像检索重新表述为目标状态重建,然后进行检索。我们使用 ASAP-CIR 实例化这个公式,这是一个无需训练框架,它使用冻结的多模态大语言模型 (MLLM) 重建静态目标表示。该表示将多个整体描述与一组可变的重要性加权原子语义相结合,从而保留整体目标身份和细粒度的视觉约束。然后,检索集成了整体状态对齐、原子约束定位和校准的目标状态证据聚合。受控的纯文本诊断表明,目标端静态查询公式比动态组合查询公式实现更可靠的检索,特别是当必须抑制或转换源状态语义时。 FashionIQ、CIRR 和 CIRCO 上的实验进一步表征了这种表示原理的有效性和局限性,在多目标 CIRCO 基准上获得了最明显的收益。这些结果表明,在检索之前如何表示组合意图是一个相应的设计选择,与检索骨干模型本身的选择不同。

从转换到目标状态:重新思考零样本组合图像检索的查询表示的原论文方法或结果图
图 2:拟议的 ASAP-CIR 框架概述。给定一个组合查询,MLLM解析器执行目标状态语义重建,并生成互补的整体描述和重要性加权原子语义。在图中,这些输出分别标记为“整体描述”和“加权原子语义”。整体描述独立编码,并通过平均池化组合,然后与全局图像特征对齐以获得整体证据评分。原子语义是独立编码的,并通过补丁方式的 softmax 分配和重要性加权聚合来针对候选补丁特征,产生原子证据评分。最后,查询式 z 分数标准化校准两个证据分数,加权线性融合产生最终的检索分数和排名。