论文
ReLoop-UME:具有可学习检索寄存器的循环深度,用于通用多模态嵌入
ReLoop-UME: Recurrent Depth with Learnable Retrieval Registers for Universal Multimodal Embedding
摘要
通用多模态嵌入 (UME) 将异构多模态输入映射到共享嵌入空间。现有的 UME 模型要么通过单个前向编码形成嵌入,要么通过显式基本原理标记和潜在自回归状态添加计算。尽管词元扩展可以改进复杂匹配,但串行生成会增加检索延迟并使最终嵌入依赖于生成的中间状态。这提出了一个不同的问题:有用的计算是否可以沿着模型深度扩展,同时保持词元工作空间固定?我们分析了独立训练的 UME 模型每一层的正负相似性分离,并观察到一个共同的进展:早期层将多模态输入置于上下文中,连续的中后期阶段形成检索判别特征,最后层将它们映射到嵌入空间。基于这一发现,我们提出了 ReLoop-UME,它执行早期层一次,循环重用参数共享的检索形成块,并在最后一个循环后应用最终映射层。可学习检索寄存器提供持久的检索特定状态,可跨循环累积和交换证据,最终寄存器用作嵌入读数。在 MMEB-V2 和 MRMR 上,ReLoop-UME 持续改进跨不同主干网的检索,同时运行速度比 UME-R1 快 44.9 倍,比 PLUME 快 1.5 倍。