论文
组合图像检索基准是否需要多模态组合?
Do Composed Image Retrieval Benchmarks Require Multimodal Composition?
摘要
组合图像检索(CIR)是一种多模态检索任务,其中查询由参考图像和文本修改组成,目标是检索满足两者的目标图像。原则上,假设 CIR 基准上的出色性能需要多模态组合,即结合参考图像和文本修改的补充信息。在这项工作中,我们表明这个假设并不总是成立。在四个广泛使用的 CIR 基准和 11 个通用多模态嵌入模型中,很大一部分查询可以使用单一模态来解决(从 32.2% 到 83.6%),揭示了普遍存在的单模态快捷方式。因此,高 CIR 性能可能来自单峰信号,而不是真正的多峰组合。为了更好地理解这个问题,我们进行了两阶段审核。首先,我们通过跨模型分析确定可快捷解决的查询。其次,我们对 4,741 个无快捷方式的查询进行了人工验证,其中只有 1,689 个格式良好,常见问题包括编辑不明确和目标不匹配。重新评估这个经过验证的子集上的模型揭示了性质不同的行为:查询不能再用单一模式来解决,并且成功的检索需要组合两个输入。虽然准确性降低,但对多模态信息的依赖却增加。总体而言,当前的 CIR 基准将可快捷解决的查询、噪声查询和真正的组合查询混为一谈,导致高估了多模态组合中的模型能力。