MARVEL:多模态自适应推理强化扩展重排序和检索
MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL
摘要
文本语料库的多模态检索仍然是一个基本挑战:最好的视觉语言编码器在推理密集型多模态检索基准 MM-BRIGHT 上仅达到 27.6 nDCG@10,性能低于强大的纯文本系统。我们认为,有效的多模态检索需要三种紧密集成的功能,而现有方法只能单独解决这些功能:扩展查询的潜在意图,使用经过复杂推理训练的模型进行检索,以及通过对候选者的显式逐步推理进行重新排序。我们引入 \textbf{MARVEL} (\textbf{M}ultimodal \textbf{A}daptive \textbf{R}easoning-intensi\textbf{V}e \textbf{E}xpand-rerank 和 retrieva\textbf{L}),这是一个结合了 LLM 驱动的查询扩展的统一管道, \textbf{MARVEL-检索器}——针对复杂多模式查询进行微调的推理增强型密集 检索器——以及基于 GPT-4o 的思想链重排序,具有可选的多通道倒数秩融合。在跨 29 个技术领域的 MM-BRIGHT 上进行评估,MARVEL 达到了 \textbf{37.9} nDCG@10,超过了最好的多模态编码器 \textbf{+10.3 个点},并在 29 个领域中的 27 个领域中超越了所有单阶段基线,并在其余两个高度专业化的领域(加密货币、量子计算)中匹配或接近了最佳基线,这表明推理密集型多模态检索是最好通过统一的扩展-检索-重新排序框架来解决。 https://github.com/mm-bright/multimodal-reasoning-retrieval