论文
FiRE:通过复杂图像检索的细粒度上下文学习增强 MLLM
FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval
摘要
由于其强大的可泛化多模态处理和推理能力,多模态 大语言模型 (MLLM) 已展现出作为通用图像 检索器 的巨大潜力,可有效解决各种现实世界的图像检索任务。然而,开创性的研究虽然很有希望,但忽视了细粒度上下文建模和解开的 微调 目标在增强 MLLM 检索性能方面的潜力,特别是对于长文本到图像检索、视觉对话检索和组合图像检索 (CIR) 等复杂任务。因此,在这项工作中,我们提出了一种自动化的细粒度多模态五元组数据集构建管道和一种新颖的两阶段细粒度多模态 微调 策略。数据集生成管道可生成具有细粒度图像描述和修改文本的综合 CIR 数据集,从而促进细粒度上下文建模。除了之前纠结的 微调 范式之外,我们的方法将 微调 过程分为两个不同的阶段:(1)面向细粒度上下文推理的 微调 和(2)面向细粒度检索的 微调。这些阶段旨在依次增强模型的上下文理解和查询目标对齐能力,从而提高检索性能。涵盖不同且复杂的图像检索任务的五个数据集的广泛实验表明,我们的方法在零样本检索设置中相对于现有方法具有显着的优越性,即使与这些方法相比具有更轻量级的 MLLM 主干。