论文

LaME:通过信息瓶颈学习在潜在空间中思考多模态嵌入

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

模型推理推理策略与问题分解

摘要

通过将思想链 (CoT) 推理引入嵌入管道,推理驱动的通用多模态嵌入得到了快速发展。尽管在一般任务和复杂任务上都有很强的性能,但这种范式存在两个核心限制:(i)自回归 CoT 推理会产生很高的计算成本,使其对于低延迟检索来说不切实际; (ii) 嵌入性能与 CoT 注释质量密切相关,导致大规模训练不可靠。这些提出了基本问题:文本 CoT 是嵌入推理的最佳形式吗?有效的嵌入推理能否在潜在空间中完成?为此,我们提出了LaME(潜在推理多模态嵌入),它将面向嵌入的潜在推理制定为弱监督信息瓶颈。 LaME 使用 K 个可学习的推理标记作为固定容量瓶颈,在一次前向传递中完成所有推理。两个弱监督信号在结构上将对比与自回归目标解耦,并消除对 CoT 注释的依赖,而两阶段训练管道确保稳定收敛。 MMEB-v2 和 MRMR 上的实验表明,LaME 实现了具有竞争力的性能,超越了一些基于显式 CoT 的模型,同时推理速度比显式 CoT 方法快 60 倍,比潜在基线快 2 倍,吞吐量与判别性嵌入模型相当。代码可在 https://github.com/PeppaWu/LaME 获取。