论文
CoCo-IR:上下文合成图像检索
CoCo-IR: Contextual Composed Image Retrieval
摘要
当前基于指令的图像检索系统功能强大,但仅限于单轮交互,无法捕捉复杂的现实世界视觉搜索的迭代本质。为了克服这一限制,我们引入了上下文合成图像检索(CoCo-IR),这是一项新颖的任务,使用户能够通过交互逐步细化搜索结果。我们通过提出一种基于大型多模态模型 (LMM) 的新模型来解决这一新任务,该模型充当 CoCo-IR 的上下文感知推理器。我们的模型解释整个交互历史,以生成跨回合演变的可变换图像嵌入(TIE)。为了在无需昂贵的人工注释的情况下为 模型训练 提供动力,我们开发了一个完全自主、可扩展的数据引擎,它利用 LMM 生成高质量的上下文检索数据,并使用模型引导的验证来挖掘具有挑战性的硬负例。大量的实验表明,我们的方法建立了新的最先进的性能:我们在具有挑战性的单圈基准 CIRCO 上实现了 39.4 mAP@5;此外,在我们新的 CoCo-IR 基准测试中,我们的模型在 4 回合对话中保持了 44.1 R@1 的稳健性能,显着优于无法处理多回合上下文的现有方法 (28.2 4-turn R@1)。项目页面:https://CoCo-IR.github.io。