论文

从失败中学习:通过硬否定的以检索为中心的 CoT 进行统一多模态检索

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

上下文与知识检索增强

摘要

统一多模态检索旨在识别满足通过异构输入表达的复杂用户意图的候选者。尽管基于大视觉语言模型 (LVLM) 的 检索器 高效且可扩展,但直接编码原始多模态输入通常会错过细粒度的判别线索,导致语义相似的候选者之间出现混淆。最近的方法通过生成思想链(CoT)基本原理来丰富查询表示来缓解这一限制。然而,这种推理通常仅源自查询:它解释了查询描述的内容,但不解释 检索器 误解的内容。我们认为有效的检索推理应该以检索反馈为条件。基于这一见解,我们引入了 UniME-R1,这是一个嵌入器-顾问框架,它学习对最初检索到的候选者进行推理并生成以检索为中心的思想链(RC-CoT)。顾问对候选人进行单独分析,以识别嵌入者混淆的歧视性线索。如果目标出现在初始的top-k集中,UniME-R1直接对候选进行重新排序;否则,它生成 RC-CoT 来细化检索方向,并使用双模式嵌入器执行全语料库重新检索。为了训练该框架,我们挖掘硬负例来模拟现实的检索失败,联合优化直接检索和 RC-CoT 增强检索,并通过监督学习和面向检索的强化学习使顾问与检索结果保持一致。对 MMEB-V2 和一组不同的通用多模态检索基准的广泛实验表明,UniME-R1 在强基线上持续提高检索性能。