论文

通过正确的视觉实例化来优化 VLP 对齐的多模态意图表示,以实现零样本合成图像检索

Optimizing VLP-aligned Multimodal Intent Representation with Correct Visual Instantiation for Zero-Shot Composed Image Retrieval

上下文与知识检索增强

摘要

ZS-CIR 的目标是在没有配对监督的情况下从参考图像和修改文本中检索目标图像,通常通过将组合查询编码为 VLP 的图像文本匹配空间内的文本主导表示来实现。然而,通过视觉伪词学习或基于 MLLM 的目标推理重建的查询通常会偏离本机 VLP 表示空间,原因是前者的参考噪声和粗文本融合,以及后者的冗长、弱视觉基础的描述。在本文中,我们提出了一个统一的 ZS-CIR 框架(称为 VMIR-CVI),从两个互补的角度重构多模态复合查询,以优化 VLP 兼容的多模态意图表示。首先,它将多模态意图推理并转换为统一的文本描述,与 VLP 主干的本地文本空间保持一致,以生成更多与检索兼容的文本查询。其次,它使用正确解耦的视觉实例线索重建查询表示,减少参考噪声,同时保留目标相关内容。具体来说,VLP 对齐的多模态意图推理 (VMIR) 模块将少量 VLP 样式示例注入到思维链提示中,指导 MLLM 生成目标一致的意图查询。免训练视觉实例解缠(TVID)模块将细粒度视觉实例与全局参考特征解耦,无需额外优化。最后,轻量级混合模式意图对齐和融合(HIAF)模块将推理的文本意图和解开的视觉线索集成到统一的混合模式表示中,以实现稳健的 ZS-CIR。对三个 CIR 基准(即 CIRR、CIRCO 和 FashionIQ)的大量实验表明,VMIR-CVI 显着优于现有基准,并实现了新的最先进性能。代码和训练后的模型将公开发布。