论文

ResComEmb:通过残余同质性压缩实现有效且高效的多模态嵌入

ResComEmb: Effective and Efficient Multimodal Embedding via Residual Homogeneity Compression

上下文与知识检索增强

摘要

多模态大语言模型(MLLM)显示出通用多模态表示学习的强大潜力。然而,现有的方法要么将每个输入压缩为单个向量,限制细粒度的表达能力,要么保留长序列的视觉标记向量,从而产生大量的存储和交互成本。为了解决这种权衡问题,我们提出了 ResComEmb,这是一个可训练的框架,用于有效且高效的通用多向量多模态嵌入。 ResComEmb 首先以原生动态分辨率将每个输入编码为有序的全局、中间和细粒度视图。经过 MLLM 上下文化和嵌入投影后,可训练的残差同质性压缩 (RHC) 模块可减少显式视觉标记预算下的粒度内冗余和跨粒度重复。然后,ResComEmb 引入了一种长度自适应双向后期交互匹配机制,用于稳健的查询文档评分,该机制对每个方向上最强的词元级别匹配进行平均,并使用基于双方拥有多少有效词元的权重来组合两个分数。在 MMEB、ViDoRe V1 和 ViDoRe V2 上进行的大量实验表明,ResComEmb 比 VLM2Vec-V2 产生了更高质量的通用多模态嵌入,并且在视觉文档检索方面优于 ColQwen2.5,仅使用其全部视​​觉词元预算的 37.5%,这证明了良好的有效性-效率权衡。