论文
全交互式通用嵌入模型
Omni-Interactive Universal Embedder
摘要
多模态表征学习正因大语言模型(LLM)具备强大的指令遵循能力,而逐渐从传统的双塔架构转向基于LLM的嵌入器。尽管取得了这些进展,现有方法主要聚焦于语言和图像模态,而语言和图像也是当前嵌入器中用户条件交互的主导模态。在本文中,我们提出首个全交互式通用嵌入器(OmniUE),它不仅利用来自专用可学习token的中间层表征,学习跨越文本、视频和音频的统一嵌入空间,还支持全交互式查询,让用户能够以文本、感兴趣的视觉区域和音频片段的形式提供输入。在OmniUE内部,视觉和音频分割器处理多样的用户交互,并将其与一个omni-LLM集成,通过上下文聚合产生用户条件下的任意到任意(any-to-any)嵌入。为评估OmniUE的全交互能力,我们引入OmniCHOIR,基于给定的文本、视频和音频以及单模态或多模态交互提示,对模型进行全交互式组合音频检索的基准测试。OmniUE在多种模态上持续超越最先进的基线,在文本交互式视频基准(MMEB-v2-video)上平均提升10.5%,在音频任务(MAEB)上提升1.1%,在视觉交互基准(SCaR)上提升83.7%,在我们的全交互OmniCHOIR基准上提升24.1%。我们相信,共同推进全模态表征学习与全交互式查询,将为通用嵌入器铺平道路。
