论文

UEmbed:统一稀疏和密集多模态嵌入

UEmbed: Unified Sparse and Dense Multimodal Embeddings

摘要

稀疏检索是现代搜索系统的基础,从网络搜索到检索增强生成。现有的工作引入了学习稀疏检索(LSR),以超越精确的词汇匹配,迈向更丰富的语义。然而,LSR 迄今为止仍然与编码器式双向架构联系在一起,其对多模态设置的扩展仍然严重依赖于辅助跨模态模块。为了解决这些限制,我们引入了 UEmbed(统一嵌入),这是一种仅解码器的多模态嵌入模型,可在一次因果前向传递中生成稀疏词汇和密集表示。 UEmbed 将 N 个可学习的特殊标记附加到输入,并将词汇表划分为 N 个不相交的子集。每个标记的因果隐藏状态预测其指定子集上的稀疏权重,并且 N 个子集连接成完整的稀疏向量。经过公共数据的训练,我们发布了 2B、4B 和 9B 尺度的 UEmbed。 UEmbed-9B 在 MMEB-v2 上达到 71.8(密集)和 71.0(稀疏),优于在公开数据(例如 RzenEmbed)上训练的多模态嵌入模型。在 BEIR 上,UEmbed 还凭借强大的密集和稀疏基线保持竞争力。此外,我们从三个维度展示了 UEmbed 的实用性:有效性、效率和代理应用。总体而言,UEmbed 提供了一种新的范式:它将密集和稀疏嵌入统一在一个模型中,同时进一步扩展稀疏检索以统一文本和多模态输入。