论文

Omni-Embed-Mini:通过密集蒸馏实现不会忘记的结合方式

Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation

摘要

将文本嵌入模型扩展到新的模态通常会降低文本检索质量,而现有的全模态嵌入器则用数十亿个参数进行补偿。我们提出了 Omni-Embed-Mini,这是一个 0.9B 参数模型,可将文本、语音、音频、图像、视频和视觉丰富的文档映射到单个共享余弦空间,而无需更新任何文本侧参数。我们的主要见解是,教师信号不需要单独的嵌入模型:每个媒体样本都与密集的级联标题配对,而教师目标只是冻结骨干网自己对该标题的嵌入。由于教师和学生共享相同的主干权重,因此他们具有相同的字节几何形状,并且轻量级投影仪加上模态编码器上的分相 LoRA 适配器足以进行对齐。训练将 Matryoshka SigLIP 对比损失与在线混合硬负矿机相结合,其负数随着编码器的改进而锐化。通过交换原生视觉语言主干,该配方延续到了 2.3B 变体。 Omni-Embed-Mini-0.9B 保持其文本权重与主干网位相同,因此训练无法回归文本检索(MTEB-v2 BEIR-8 上的 49.57 nDCG@10),同时将其扩展到五个附加模式,并且比我们比较的每个开放式全向嵌入器小约 2.7 倍到 9.5 倍。 2.3B 变体与封闭的 Gemini-embedding-2 具有竞争力,在整体模态平均值上领先于它。模型、代码、数据和评估Harness位于我们的项目页面上:https://omniembed.cvmbzuai.com