论文

ReWAM:以检索依据引导通用多模态嵌入推理

Reason What Matters: Retrieval-Grounded Reasoning for Universal Multimodal Embeddings

模型训练强化学习奖励建模与过程监督RLVR

摘要

通用多模态嵌入(UME)学习跨模态的统一表示,使单个模型能够支持不同的检索任务。最近的方法使用思想链 (CoT) 推理来更好地解释多模态输入,然后再为复杂的检索任务生成嵌入,并通过基于检索的奖励的 GRPO 进一步优化此推理过程。然而,有两个限制阻碍了语料库规模的部署。 GRPO 为所有 CoT token分配相同的优势,而没有识别输入支持的主张或区分积极与消极的证据。此外,即使部分跟踪已经提供了足够的检索证据,在每次嵌入之前生成完整的 CoT 也会引入大量延迟。为了解决这些限制,我们提出了 Reason What Matters (ReWAM),这是一种基于检索的推理框架,它使用检索反馈来指导学分分配和推理计算。具体来说,我们引入了检索感知自蒸馏(RASD),它根据输入支持的证据构建特权指导,将正面项目与检索到的硬负面项目区分开来。政策自学教师使用此指导将轨迹级反馈细化为特定于标记的监督,以进行检索相关的推理。我们进一步开发了检索自适应推理(RAI),它使用检索置信头来估计部分 CoT 的剩余检索效用。它会尽早停止无用的跟踪,并通过推测解码加速有用的延续。对 MMEB-V2 和 MRMR 的大量实验表明,ReWAM 实现了最先进的检索性能,同时提供的推理吞吐量是竞争性显式 CoT UME 方法的 5 倍。这些结果弥补了检索质量和推理效率之间的差距,使推理增强 UME 适合大规模部署。

ReWAM:以检索依据引导通用多模态嵌入推理:论文配图
图1:推理增强统一多模态嵌入范式及实证比较。(a)至(c)分别为生成式推理UME、解耦推理UME及ReWAM;(d)比较分布内与分布外检索,GRPO在分布外任务上的收益更小;(e)比较不同UME方法的检索性能与吞吐量。