论文

ReCQR:结合会话查询重写来改进多模式图像检索

ReCQR: Incorporating conversational query rewriting to improve Multimodal Image Retrieval

模型评测基准与评测资源

摘要

随着多模态学习的兴起,图像检索在将视觉信息与自然语言查询连接起来方面发挥着至关重要的作用。现有图像 检索器 难以处理长文本和不清楚的用户表达。为了解决这些问题,我们将会话查询重写(CQR)任务引入图像检索领域,并构建专用的多轮对话查询重写数据集。 CQR 基于完整的对话历史记录,将用户的最终查询重写为简洁、语义完整的查询,更适合检索。具体来说,我们首先利用 大语言模型 (LLM) 大规模生成重写的候选者,并采用 LLM-as-Judge 机制结合人工审核来策划大约 7,000 个高质量的多模态对话,形成 ReCQR 数据集。然后我们在 ReCQR 数据集上对几个 SOTA 多模态模型进行基准测试,以评估它们在图像检索方面的性能。实验结果表明,CQR 不仅显着提高了传统图像检索模型的准确性,而且为多模态系统中的用户查询建模提供了新的方向和见解。