论文

需要时思考:采用双 LoRA 架构的自适应推理驱动的多模态嵌入

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

模型推理测试时计算扩展

摘要

多模态 大语言模型 (MLLM) 已成为多模态嵌入的强大支柱。最近的方法将思想链(CoT)推理引入嵌入管道中以提高检索质量,但模型大小和推理成本仍然很高。他们通常采用具有大量参数开销的独立推理器和嵌入器,并为每个输入不加区别地生成 CoT。然而,我们观察到,对于简单的输入,判别性嵌入已经表现良好,冗余推理甚至会误导模型,降低性能。为了解决这些限制,我们提出了 Think When Needed (TWN),这是一种具有自适应推理功能的统一多模态嵌入框架。 TWN 引入了双 LoRA 架构,将推理和嵌入适配器附加到共享的冻结主干上,在其接口处分离梯度,以减轻联合优化引入的梯度冲突,同时保持参数接近单个模型。在此基础上,自适应思考机制使用自监督路由门来决定每个输入是否生成 CoT,跳过不必要的推理以减少推理开销,甚至提高检索质量。我们进一步探索嵌入引导的 RL,以优化监督训练之外的 CoT 质量。在 MMEB-V2 的 78 项任务中,TWN 实现了最先进的嵌入质量,同时比现有的生成方法更加高效,相对于主干网仅需要 3-5% 的额外参数,与完整生成模式相比,推理标记最多减少 50%。