论文
Ovis-Embedding:推进通用全模态嵌入的前沿
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
摘要
本报告提出 Ovis-Embedding,一个最先进的全模态嵌入家族,原生整合文本、图像、视频与音频。Ovis-Embedding 不拼装分离的模态塔,而是使用共享的多模态骨干将不同模态编码到同一表示空间。具体而言,我们取得三项关键进展:(1) 原生全模态初始化:采用预训练的 Qwen-omni 模型作为嵌入骨干,并通过低秩初始化的对比训练加以适配;(2) 以数据为中心的全模态训练:构建覆盖文本、图像、视频、音频及交错多模态数据的广泛高质量语料,并引入同源采样以构造任务一致的批次与信息量丰富的批内负例,提升数据效率;(3) 面向嵌入的训练与推理优化:使用 focal loss 强调困难样本,并采用基于相似度的嵌入蒸馏从互补专家迁移细粒度相似性结构。推理时,低秩特征分解支持维度灵活、性能损失极小的紧凑嵌入。实证评估显示,Ovis-Embedding 家族在 MMEB-v3、MMEB-v2、MVEB、MAEB 与 RTEB 上取得最先进性能,证明了其在文本、图像、视频与音频模态上的有效性。这些结果凸显了统一全模态训练克服模态碎片化、推进任意到任意检索通用嵌入模型的潜力。
