论文

BRIDGE:通过强化学习查询对齐进行多模式到文本检索

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

上下文与知识检索增强

摘要

多模态检索系统很难解决针对纯文本语料库的图像文本查询:最好的视觉语言编码器在 MM-BRIGHT 上仅实现 27.6 nDCG@10,性能低于强大的纯文本 检索器。我们认为瓶颈不是 检索器 而是查询——原始多模态查询以系统地降低嵌入相似性的方式纠缠视觉描述、对话噪声和检索意图。我们提出了 \textbf{BRIDGE},这是一个两组件系统,可以在没有多模态编码器的情况下解决这种不匹配问题。 \textbf{FORGE} (\textbf{F}ocused Retrieval Query Generato\textbf{r}) 是一种通过强化学习训练的查询对齐模型,它将嘈杂的多模态查询提炼为紧凑的、检索优化的搜索字符串。 \textbf{LENS} (\textbf{L}anguage-\textbf{E}nhanced \textbf{N}eural \textbf{S}earch) 是一个推理增强密集 检索器,针对推理密集型检索数据进行微调,以处理 FORGE 产生的意图丰富的查询。在 MM-BRIGHT(2,803 个查询,29 个域)上进行评估,BRIDGE 达到了 \textbf{29.7} nDCG@10,超越了包括 Nomic-Vision (27.6) 在内的所有多模式编码器基线。当 FORGE 用作 Nomic-Vision 之上的即插即用对齐器时,组合系统达到 \textbf{33.3} nDCG@10 - 超过了最好的纯文本 检索器 (32.2) - 证明 \textit{查询对齐} 是多模式到文本检索的关键瓶颈。 https://github.com/mm-bright/multimodal-reasoning-retrieval